73 lines
3.4 KiB
Markdown
73 lines
3.4 KiB
Markdown
---
|
||
title: "GenCeption — Video Generation as General-Purpose Vision Pre-training (ECCV 2026)"
|
||
created: 2026-07-13
|
||
updated: 2026-07-13
|
||
type: paper
|
||
tags: [computer-vision, video-generation, diffusion, pre-training, generalist-model]
|
||
sources:
|
||
- https://arxiv.org/abs/2607.09024
|
||
- https://genception.github.io
|
||
---
|
||
|
||
# GenCeption — Video Generation as General-Purpose Vision Pre-training
|
||
|
||
## 中文摘要
|
||
|
||
GenCeption 提出 **大规模文本到视频生成是计算机视觉的通用预训练范式**——就像 next-token prediction 之于 NLP。将预训练的视频扩散模型改造为单步前馈感知模型,通过文本指令驱动多种视觉任务(深度、法向、相机姿态、分割、3D 关键点),在统一架构下匹配甚至超越专用模型,且数据效率极高(7-500× 更少训练数据)。
|
||
|
||
## 核心洞察
|
||
|
||
NLP 通过 next-token prediction 实现了从专用模型到通用基础模型的范式转变。CV 仍停留在"专用模型"阶段(SAM 做分割、DepthAnything 做深度…)。GenCeption 的核心主张:**视频生成预训练就是 CV 的 next-token prediction 等价物**。
|
||
|
||
## 三大必要条件
|
||
|
||
[[three-imperatives-vision|通用视觉预训练三条件]]:
|
||
1. **时空演化**(Spatio-Temporal Evolution):世界是 4D 连续体,预训练目标必须迫使模型内化 4D 因果和物理
|
||
2. **视觉-语言对齐**(Vision-Language Alignment):视觉特征应与语言语义原生对齐
|
||
3. **可规模化**(Scalability):数据和计算可大规模扩展
|
||
|
||
## 方法论:从扩散生成到前馈感知
|
||
|
||
### [[feed-forward-diffusion|前馈扩散改造]]
|
||
将多步迭代扩散 DiT 改造为单步前馈感知模型:
|
||
- 输入改为干净视频 latent(非噪声)
|
||
- 时间步固定 t=0
|
||
- 取反 velocity 输出(Rectified Flow 的 v = ε - x₀ → -v = x₀ - ε)
|
||
- 仅用最后一层特征,不做架构修改
|
||
|
||
### [[unified-task-representation|统一任务表示]]
|
||
- **稠密任务**(深度/法向/分割/DensePose/相机):全部映射到 3 通道 RGB 空间
|
||
- **[[rothko-raymap|Rothko Raymap]]**:将 6 通道相机光线数据(旋转+平移)压缩为单张 3 通道图
|
||
- **稀疏任务**(2D/3D 关键点):通过 [[learnable-tokens-sparse|可学习 token]] 附加到视频 latent,MLP 解码
|
||
|
||
### [[data-driven-task-specification|数据驱动的任务规约]]
|
||
任务规范从架构修改转移到数据格式设计——新增视觉能力不需改变架构或训练配方,仅需调整数据表示。
|
||
|
||
## 关键结果
|
||
|
||
| 能力 | 对标模型 | 数据效率 |
|
||
|------|---------|----------|
|
||
| 深度估计 | DepthAnything V3 | ~匹配 |
|
||
| 分割 | SAM3 | ~匹配 |
|
||
| 3D 姿态 | D4RT, VGGT-Ω | 7-500× 更少数据 |
|
||
| 法向估计 | Sapiens | 超越 |
|
||
| Sim-to-Real | — | 合成人→真实动物/机器人 |
|
||
|
||
## 涌现行为
|
||
|
||
仅用合成人类视频训练 → 泛化到真实视频、动物、机器人等 OOD 类别。这暗示视频生成预训练内化了**可迁移的通用视觉先验**。
|
||
|
||
## 相关概念
|
||
|
||
- [[video-generation-pretraining|视频生成预训练]]
|
||
- [[feed-forward-diffusion|前馈扩散]]
|
||
- [[unified-task-representation|统一任务表示]]
|
||
- [[diffusion-as-feature-extractor|扩散特征提取]]
|
||
- [[sim-to-real-transfer-vision|Sim-to-Real 迁移]]
|
||
|
||
## 来源
|
||
|
||
- [原始存档](raw/papers/genception-video-vision-2026.md)
|
||
- arXiv: https://arxiv.org/abs/2607.09024
|
||
- Project: https://genception.github.io
|