Files
myWiki/concepts/three-imperatives-vision.md
2026-07-20 14:14:55 +08:00

50 lines
1.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training)"
created: 2026-07-13
updated: 2026-07-13
type: concept
tags: [computer-vision, pre-training, generalist-model]
sources:
- arxiv:2607.09024
---
# 通用视觉预训练三条件
## 定义
GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。
## 三条件
### 1. 时空演化 (Spatio-Temporal Evolution)
> "世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。"
- 需要理解物体恒存性、3D 几何、物理交互、时间因果
- 视频生成天然满足:生成下一帧 = 隐式理解运动规律
### 2. 视觉-语言对齐 (Vision-Language Alignment)
> "为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。"
- 需要:开放词汇理解、文本引导的任务切换
- 文本到视频生成天然满足:模型以文本描述为条件
### 3. 可规模化 (Scalability)
> "范式应能在数据和计算上规模化,最终促成视觉智能的涌现。"
- 需要:低成本标注(或自监督)、高商业价值驱动规模化
- 视频生成天然满足:互联网视频近乎无限,文本描述成本低
## 评估现有范式
| 条件 | MAE | DINO/CLIP | V-JEPA | 视频生成 |
|------|-----|-----------|--------|----------|
| 时空演化 | ❌ | ❌ | 部分 | ✅ |
| VL 对齐 | ❌ | ✅ | ❌ | ✅ |
| 可规模化 | 部分 | ✅ | 部分 | ✅ |
只有**视频生成预训练**同时满足全部三个条件。
## 参考
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
- [[video-generation-pretraining|视频生成预训练]]