Files
myWiki/concepts/three-imperatives-vision.md
2026-07-20 14:14:55 +08:00

1.8 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training) 2026-07-13 2026-07-13 concept
computer-vision
pre-training
generalist-model
arxiv:2607.09024

通用视觉预训练三条件

定义

GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。

三条件

1. 时空演化 (Spatio-Temporal Evolution)

"世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。"

  • 需要理解物体恒存性、3D 几何、物理交互、时间因果
  • 视频生成天然满足:生成下一帧 = 隐式理解运动规律

2. 视觉-语言对齐 (Vision-Language Alignment)

"为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。"

  • 需要:开放词汇理解、文本引导的任务切换
  • 文本到视频生成天然满足:模型以文本描述为条件

3. 可规模化 (Scalability)

"范式应能在数据和计算上规模化,最终促成视觉智能的涌现。"

  • 需要:低成本标注(或自监督)、高商业价值驱动规模化
  • 视频生成天然满足:互联网视频近乎无限,文本描述成本低

评估现有范式

条件 MAE DINO/CLIP V-JEPA 视频生成
时空演化 部分
VL 对齐
可规模化 部分 部分

只有视频生成预训练同时满足全部三个条件。

参考