50 lines
1.8 KiB
Markdown
50 lines
1.8 KiB
Markdown
---
|
||
title: "通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training)"
|
||
created: 2026-07-13
|
||
updated: 2026-07-13
|
||
type: concept
|
||
tags: [computer-vision, pre-training, generalist-model]
|
||
sources:
|
||
- arxiv:2607.09024
|
||
---
|
||
|
||
# 通用视觉预训练三条件
|
||
|
||
## 定义
|
||
|
||
GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。
|
||
|
||
## 三条件
|
||
|
||
### 1. 时空演化 (Spatio-Temporal Evolution)
|
||
> "世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。"
|
||
|
||
- 需要:理解物体恒存性、3D 几何、物理交互、时间因果
|
||
- 视频生成天然满足:生成下一帧 = 隐式理解运动规律
|
||
|
||
### 2. 视觉-语言对齐 (Vision-Language Alignment)
|
||
> "为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。"
|
||
|
||
- 需要:开放词汇理解、文本引导的任务切换
|
||
- 文本到视频生成天然满足:模型以文本描述为条件
|
||
|
||
### 3. 可规模化 (Scalability)
|
||
> "范式应能在数据和计算上规模化,最终促成视觉智能的涌现。"
|
||
|
||
- 需要:低成本标注(或自监督)、高商业价值驱动规模化
|
||
- 视频生成天然满足:互联网视频近乎无限,文本描述成本低
|
||
|
||
## 评估现有范式
|
||
|
||
| 条件 | MAE | DINO/CLIP | V-JEPA | 视频生成 |
|
||
|------|-----|-----------|--------|----------|
|
||
| 时空演化 | ❌ | ❌ | 部分 | ✅ |
|
||
| VL 对齐 | ❌ | ✅ | ❌ | ✅ |
|
||
| 可规模化 | 部分 | ✅ | 部分 | ✅ |
|
||
|
||
只有**视频生成预训练**同时满足全部三个条件。
|
||
|
||
## 参考
|
||
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
|
||
- [[video-generation-pretraining|视频生成预训练]]
|