--- title: "通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training)" created: 2026-07-13 updated: 2026-07-13 type: concept tags: [computer-vision, pre-training, generalist-model] sources: - arxiv:2607.09024 --- # 通用视觉预训练三条件 ## 定义 GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。 ## 三条件 ### 1. 时空演化 (Spatio-Temporal Evolution) > "世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。" - 需要:理解物体恒存性、3D 几何、物理交互、时间因果 - 视频生成天然满足:生成下一帧 = 隐式理解运动规律 ### 2. 视觉-语言对齐 (Vision-Language Alignment) > "为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。" - 需要:开放词汇理解、文本引导的任务切换 - 文本到视频生成天然满足:模型以文本描述为条件 ### 3. 可规模化 (Scalability) > "范式应能在数据和计算上规模化,最终促成视觉智能的涌现。" - 需要:低成本标注(或自监督)、高商业价值驱动规模化 - 视频生成天然满足:互联网视频近乎无限,文本描述成本低 ## 评估现有范式 | 条件 | MAE | DINO/CLIP | V-JEPA | 视频生成 | |------|-----|-----------|--------|----------| | 时空演化 | ❌ | ❌ | 部分 | ✅ | | VL 对齐 | ❌ | ✅ | ❌ | ✅ | | 可规模化 | 部分 | ✅ | 部分 | ✅ | 只有**视频生成预训练**同时满足全部三个条件。 ## 参考 - [[genception-video-vision-2026|GenCeption (ECCV 2026)]] - [[video-generation-pretraining|视频生成预训练]]