Files
myWiki/papers/genception-video-vision-2026.md
2026-07-20 14:14:55 +08:00

73 lines
3.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "GenCeption — Video Generation as General-Purpose Vision Pre-training (ECCV 2026)"
created: 2026-07-13
updated: 2026-07-13
type: paper
tags: [computer-vision, video-generation, diffusion, pre-training, generalist-model]
sources:
- https://arxiv.org/abs/2607.09024
- https://genception.github.io
---
# GenCeption — Video Generation as General-Purpose Vision Pre-training
## 中文摘要
GenCeption 提出 **大规模文本到视频生成是计算机视觉的通用预训练范式**——就像 next-token prediction 之于 NLP。将预训练的视频扩散模型改造为单步前馈感知模型通过文本指令驱动多种视觉任务深度、法向、相机姿态、分割、3D 关键点在统一架构下匹配甚至超越专用模型且数据效率极高7-500× 更少训练数据)。
## 核心洞察
NLP 通过 next-token prediction 实现了从专用模型到通用基础模型的范式转变。CV 仍停留在"专用模型"阶段SAM 做分割、DepthAnything 做深度…。GenCeption 的核心主张:**视频生成预训练就是 CV 的 next-token prediction 等价物**。
## 三大必要条件
[[three-imperatives-vision|通用视觉预训练三条件]]
1. **时空演化**Spatio-Temporal Evolution世界是 4D 连续体,预训练目标必须迫使模型内化 4D 因果和物理
2. **视觉-语言对齐**Vision-Language Alignment视觉特征应与语言语义原生对齐
3. **可规模化**Scalability数据和计算可大规模扩展
## 方法论:从扩散生成到前馈感知
### [[feed-forward-diffusion|前馈扩散改造]]
将多步迭代扩散 DiT 改造为单步前馈感知模型:
- 输入改为干净视频 latent非噪声
- 时间步固定 t=0
- 取反 velocity 输出Rectified Flow 的 v = ε - x₀ → -v = x₀ - ε)
- 仅用最后一层特征,不做架构修改
### [[unified-task-representation|统一任务表示]]
- **稠密任务**(深度/法向/分割/DensePose/相机):全部映射到 3 通道 RGB 空间
- **[[rothko-raymap|Rothko Raymap]]**:将 6 通道相机光线数据(旋转+平移)压缩为单张 3 通道图
- **稀疏任务**2D/3D 关键点):通过 [[learnable-tokens-sparse|可学习 token]] 附加到视频 latentMLP 解码
### [[data-driven-task-specification|数据驱动的任务规约]]
任务规范从架构修改转移到数据格式设计——新增视觉能力不需改变架构或训练配方,仅需调整数据表示。
## 关键结果
| 能力 | 对标模型 | 数据效率 |
|------|---------|----------|
| 深度估计 | DepthAnything V3 | ~匹配 |
| 分割 | SAM3 | ~匹配 |
| 3D 姿态 | D4RT, VGGT-Ω | 7-500× 更少数据 |
| 法向估计 | Sapiens | 超越 |
| Sim-to-Real | — | 合成人→真实动物/机器人 |
## 涌现行为
仅用合成人类视频训练 → 泛化到真实视频、动物、机器人等 OOD 类别。这暗示视频生成预训练内化了**可迁移的通用视觉先验**。
## 相关概念
- [[video-generation-pretraining|视频生成预训练]]
- [[feed-forward-diffusion|前馈扩散]]
- [[unified-task-representation|统一任务表示]]
- [[diffusion-as-feature-extractor|扩散特征提取]]
- [[sim-to-real-transfer-vision|Sim-to-Real 迁移]]
## 来源
- [原始存档](raw/papers/genception-video-vision-2026.md)
- arXiv: https://arxiv.org/abs/2607.09024
- Project: https://genception.github.io