1.8 KiB
1.8 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | ||||
|---|---|---|---|---|---|---|---|---|---|
| 通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training) | 2026-07-13 | 2026-07-13 | concept |
|
|
通用视觉预训练三条件
定义
GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。
三条件
1. 时空演化 (Spatio-Temporal Evolution)
"世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。"
- 需要:理解物体恒存性、3D 几何、物理交互、时间因果
- 视频生成天然满足:生成下一帧 = 隐式理解运动规律
2. 视觉-语言对齐 (Vision-Language Alignment)
"为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。"
- 需要:开放词汇理解、文本引导的任务切换
- 文本到视频生成天然满足:模型以文本描述为条件
3. 可规模化 (Scalability)
"范式应能在数据和计算上规模化,最终促成视觉智能的涌现。"
- 需要:低成本标注(或自监督)、高商业价值驱动规模化
- 视频生成天然满足:互联网视频近乎无限,文本描述成本低
评估现有范式
| 条件 | MAE | DINO/CLIP | V-JEPA | 视频生成 |
|---|---|---|---|---|
| 时空演化 | ❌ | ❌ | 部分 | ✅ |
| VL 对齐 | ❌ | ✅ | ❌ | ✅ |
| 可规模化 | 部分 | ✅ | 部分 | ✅ |
只有视频生成预训练同时满足全部三个条件。