Files
myWiki/papers/genception-video-vision-2026.md
2026-07-20 14:14:55 +08:00

3.4 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
GenCeption — Video Generation as General-Purpose Vision Pre-training (ECCV 2026) 2026-07-13 2026-07-13 paper
computer-vision
video-generation
diffusion
pre-training
generalist-model
https://arxiv.org/abs/2607.09024
https://genception.github.io

GenCeption — Video Generation as General-Purpose Vision Pre-training

中文摘要

GenCeption 提出 大规模文本到视频生成是计算机视觉的通用预训练范式——就像 next-token prediction 之于 NLP。将预训练的视频扩散模型改造为单步前馈感知模型通过文本指令驱动多种视觉任务深度、法向、相机姿态、分割、3D 关键点在统一架构下匹配甚至超越专用模型且数据效率极高7-500× 更少训练数据)。

核心洞察

NLP 通过 next-token prediction 实现了从专用模型到通用基础模型的范式转变。CV 仍停留在"专用模型"阶段SAM 做分割、DepthAnything 做深度…。GenCeption 的核心主张:视频生成预训练就是 CV 的 next-token prediction 等价物

三大必要条件

three-imperatives-vision

  1. 时空演化Spatio-Temporal Evolution世界是 4D 连续体,预训练目标必须迫使模型内化 4D 因果和物理
  2. 视觉-语言对齐Vision-Language Alignment视觉特征应与语言语义原生对齐
  3. 可规模化Scalability数据和计算可大规模扩展

方法论:从扩散生成到前馈感知

feed-forward-diffusion

将多步迭代扩散 DiT 改造为单步前馈感知模型:

  • 输入改为干净视频 latent非噪声
  • 时间步固定 t=0
  • 取反 velocity 输出Rectified Flow 的 v = ε - x₀ → -v = x₀ - ε)
  • 仅用最后一层特征,不做架构修改

unified-task-representation

  • 稠密任务(深度/法向/分割/DensePose/相机):全部映射到 3 通道 RGB 空间
  • rothko-raymap:将 6 通道相机光线数据(旋转+平移)压缩为单张 3 通道图
  • 稀疏任务2D/3D 关键点):通过 learnable-tokens-sparse 附加到视频 latentMLP 解码

data-driven-task-specification

任务规范从架构修改转移到数据格式设计——新增视觉能力不需改变架构或训练配方,仅需调整数据表示。

关键结果

能力 对标模型 数据效率
深度估计 DepthAnything V3 ~匹配
分割 SAM3 ~匹配
3D 姿态 D4RT, VGGT-Ω 7-500× 更少数据
法向估计 Sapiens 超越
Sim-to-Real 合成人→真实动物/机器人

涌现行为

仅用合成人类视频训练 → 泛化到真实视频、动物、机器人等 OOD 类别。这暗示视频生成预训练内化了可迁移的通用视觉先验

相关概念

来源