3.4 KiB
3.4 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| GenCeption — Video Generation as General-Purpose Vision Pre-training (ECCV 2026) | 2026-07-13 | 2026-07-13 | paper |
|
|
GenCeption — Video Generation as General-Purpose Vision Pre-training
中文摘要
GenCeption 提出 大规模文本到视频生成是计算机视觉的通用预训练范式——就像 next-token prediction 之于 NLP。将预训练的视频扩散模型改造为单步前馈感知模型,通过文本指令驱动多种视觉任务(深度、法向、相机姿态、分割、3D 关键点),在统一架构下匹配甚至超越专用模型,且数据效率极高(7-500× 更少训练数据)。
核心洞察
NLP 通过 next-token prediction 实现了从专用模型到通用基础模型的范式转变。CV 仍停留在"专用模型"阶段(SAM 做分割、DepthAnything 做深度…)。GenCeption 的核心主张:视频生成预训练就是 CV 的 next-token prediction 等价物。
三大必要条件
- 时空演化(Spatio-Temporal Evolution):世界是 4D 连续体,预训练目标必须迫使模型内化 4D 因果和物理
- 视觉-语言对齐(Vision-Language Alignment):视觉特征应与语言语义原生对齐
- 可规模化(Scalability):数据和计算可大规模扩展
方法论:从扩散生成到前馈感知
feed-forward-diffusion
将多步迭代扩散 DiT 改造为单步前馈感知模型:
- 输入改为干净视频 latent(非噪声)
- 时间步固定 t=0
- 取反 velocity 输出(Rectified Flow 的 v = ε - x₀ → -v = x₀ - ε)
- 仅用最后一层特征,不做架构修改
unified-task-representation
- 稠密任务(深度/法向/分割/DensePose/相机):全部映射到 3 通道 RGB 空间
- rothko-raymap:将 6 通道相机光线数据(旋转+平移)压缩为单张 3 通道图
- 稀疏任务(2D/3D 关键点):通过 learnable-tokens-sparse 附加到视频 latent,MLP 解码
data-driven-task-specification
任务规范从架构修改转移到数据格式设计——新增视觉能力不需改变架构或训练配方,仅需调整数据表示。
关键结果
| 能力 | 对标模型 | 数据效率 |
|---|---|---|
| 深度估计 | DepthAnything V3 | ~匹配 |
| 分割 | SAM3 | ~匹配 |
| 3D 姿态 | D4RT, VGGT-Ω | 7-500× 更少数据 |
| 法向估计 | Sapiens | 超越 |
| Sim-to-Real | — | 合成人→真实动物/机器人 |
涌现行为
仅用合成人类视频训练 → 泛化到真实视频、动物、机器人等 OOD 类别。这暗示视频生成预训练内化了可迁移的通用视觉先验。
相关概念
- video-generation-pretraining
- feed-forward-diffusion
- unified-task-representation
- diffusion-as-feature-extractor
- sim-to-real-transfer-vision
来源
- 原始存档
- arXiv: https://arxiv.org/abs/2607.09024
- Project: https://genception.github.io