20260720
This commit is contained in:
49
concepts/three-imperatives-vision.md
Normal file
49
concepts/three-imperatives-vision.md
Normal file
@@ -0,0 +1,49 @@
|
||||
---
|
||||
title: "通用视觉预训练三条件 (Three Imperatives for Generalist Vision Pre-training)"
|
||||
created: 2026-07-13
|
||||
updated: 2026-07-13
|
||||
type: concept
|
||||
tags: [computer-vision, pre-training, generalist-model]
|
||||
sources:
|
||||
- arxiv:2607.09024
|
||||
---
|
||||
|
||||
# 通用视觉预训练三条件
|
||||
|
||||
## 定义
|
||||
|
||||
GenCeption 提出的通用视觉基础模型预训练必须满足的三个必要条件。这些条件是判断一个预训练范式能否成为"视觉的 next-token prediction 等价物"的标准。
|
||||
|
||||
## 三条件
|
||||
|
||||
### 1. 时空演化 (Spatio-Temporal Evolution)
|
||||
> "世界是 4D 连续体。预训练目标必须迫使模型内化运动世界的 4D 时间因果和物理学。"
|
||||
|
||||
- 需要:理解物体恒存性、3D 几何、物理交互、时间因果
|
||||
- 视频生成天然满足:生成下一帧 = 隐式理解运动规律
|
||||
|
||||
### 2. 视觉-语言对齐 (Vision-Language Alignment)
|
||||
> "为继承语言模型的指令遵循能力和常识知识,视觉特征应在预训练和后训练阶段都与语言语义原生对齐。"
|
||||
|
||||
- 需要:开放词汇理解、文本引导的任务切换
|
||||
- 文本到视频生成天然满足:模型以文本描述为条件
|
||||
|
||||
### 3. 可规模化 (Scalability)
|
||||
> "范式应能在数据和计算上规模化,最终促成视觉智能的涌现。"
|
||||
|
||||
- 需要:低成本标注(或自监督)、高商业价值驱动规模化
|
||||
- 视频生成天然满足:互联网视频近乎无限,文本描述成本低
|
||||
|
||||
## 评估现有范式
|
||||
|
||||
| 条件 | MAE | DINO/CLIP | V-JEPA | 视频生成 |
|
||||
|------|-----|-----------|--------|----------|
|
||||
| 时空演化 | ❌ | ❌ | 部分 | ✅ |
|
||||
| VL 对齐 | ❌ | ✅ | ❌ | ✅ |
|
||||
| 可规模化 | 部分 | ✅ | 部分 | ✅ |
|
||||
|
||||
只有**视频生成预训练**同时满足全部三个条件。
|
||||
|
||||
## 参考
|
||||
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
|
||||
- [[video-generation-pretraining|视频生成预训练]]
|
||||
Reference in New Issue
Block a user