1.8 KiB
1.8 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| 视频生成预训练 (Video Generation Pre-training) | 2026-07-13 | 2026-07-13 | concept |
|
|
视频生成预训练
定义
视频生成预训练是 GenCeption 提出的核心范式:将大规模文本到视频生成作为计算机视觉的通用预训练策略。这是 NLP 中 next-token prediction 的视觉等价物。
核心主张
视频生成预训练独特地满足通用视觉预训练的 three-imperatives-vision:
- 时空演化:生成高保真视频序列迫使模型内化 3D 几何、物体恒存性和物理交互
- 视觉-语言对齐:模型原生以文本为条件,提供内在的多模态对齐
- 规模化:由于标注成本低和商业价值高,现代视频生成模型已在大规模数据和计算上训练
与现有预训练范式的对比
| 范式 | 时空先验 | VL 对齐 | 规模化 | 代表方法 |
|---|---|---|---|---|
| MAE / VideoMAE | 弱 | 无 | 受限 | Masked Autoencoder |
| DINO / DINOv2 | 无 | 无 | 中等 | Self-Distillation |
| CLIP / SigLip | 无 | 强 | 强 | Contrastive Learning |
| V-JEPA | 弱 | 无 | 受限 | Feature Prediction |
| 视频生成预训练 | 强 | 强 | 强 | GenCeption |
NLP 类比
就像 next-token prediction 内化了语法、语义和世界知识,视频帧生成内化了 3D 几何、物理学和视觉语义。
GenCeption 将视频扩散模型视为"基础模型",在其上进行多任务后训练——完全类比 LLM 的 pre-training → post-training 流程。