--- title: "GenCeption — Video Generation as General-Purpose Vision Pre-training (ECCV 2026)" created: 2026-07-13 updated: 2026-07-13 type: paper tags: [computer-vision, video-generation, diffusion, pre-training, generalist-model] sources: - https://arxiv.org/abs/2607.09024 - https://genception.github.io --- # GenCeption — Video Generation as General-Purpose Vision Pre-training ## 中文摘要 GenCeption 提出 **大规模文本到视频生成是计算机视觉的通用预训练范式**——就像 next-token prediction 之于 NLP。将预训练的视频扩散模型改造为单步前馈感知模型,通过文本指令驱动多种视觉任务(深度、法向、相机姿态、分割、3D 关键点),在统一架构下匹配甚至超越专用模型,且数据效率极高(7-500× 更少训练数据)。 ## 核心洞察 NLP 通过 next-token prediction 实现了从专用模型到通用基础模型的范式转变。CV 仍停留在"专用模型"阶段(SAM 做分割、DepthAnything 做深度…)。GenCeption 的核心主张:**视频生成预训练就是 CV 的 next-token prediction 等价物**。 ## 三大必要条件 [[three-imperatives-vision|通用视觉预训练三条件]]: 1. **时空演化**(Spatio-Temporal Evolution):世界是 4D 连续体,预训练目标必须迫使模型内化 4D 因果和物理 2. **视觉-语言对齐**(Vision-Language Alignment):视觉特征应与语言语义原生对齐 3. **可规模化**(Scalability):数据和计算可大规模扩展 ## 方法论:从扩散生成到前馈感知 ### [[feed-forward-diffusion|前馈扩散改造]] 将多步迭代扩散 DiT 改造为单步前馈感知模型: - 输入改为干净视频 latent(非噪声) - 时间步固定 t=0 - 取反 velocity 输出(Rectified Flow 的 v = ε - x₀ → -v = x₀ - ε) - 仅用最后一层特征,不做架构修改 ### [[unified-task-representation|统一任务表示]] - **稠密任务**(深度/法向/分割/DensePose/相机):全部映射到 3 通道 RGB 空间 - **[[rothko-raymap|Rothko Raymap]]**:将 6 通道相机光线数据(旋转+平移)压缩为单张 3 通道图 - **稀疏任务**(2D/3D 关键点):通过 [[learnable-tokens-sparse|可学习 token]] 附加到视频 latent,MLP 解码 ### [[data-driven-task-specification|数据驱动的任务规约]] 任务规范从架构修改转移到数据格式设计——新增视觉能力不需改变架构或训练配方,仅需调整数据表示。 ## 关键结果 | 能力 | 对标模型 | 数据效率 | |------|---------|----------| | 深度估计 | DepthAnything V3 | ~匹配 | | 分割 | SAM3 | ~匹配 | | 3D 姿态 | D4RT, VGGT-Ω | 7-500× 更少数据 | | 法向估计 | Sapiens | 超越 | | Sim-to-Real | — | 合成人→真实动物/机器人 | ## 涌现行为 仅用合成人类视频训练 → 泛化到真实视频、动物、机器人等 OOD 类别。这暗示视频生成预训练内化了**可迁移的通用视觉先验**。 ## 相关概念 - [[video-generation-pretraining|视频生成预训练]] - [[feed-forward-diffusion|前馈扩散]] - [[unified-task-representation|统一任务表示]] - [[diffusion-as-feature-extractor|扩散特征提取]] - [[sim-to-real-transfer-vision|Sim-to-Real 迁移]] ## 来源 - [原始存档](raw/papers/genception-video-vision-2026.md) - arXiv: https://arxiv.org/abs/2607.09024 - Project: https://genception.github.io