20260720
This commit is contained in:
44
concepts/video-generation-pretraining.md
Normal file
44
concepts/video-generation-pretraining.md
Normal file
@@ -0,0 +1,44 @@
|
||||
---
|
||||
title: "视频生成预训练 (Video Generation Pre-training)"
|
||||
created: 2026-07-13
|
||||
updated: 2026-07-13
|
||||
type: concept
|
||||
tags: [computer-vision, pre-training, video-generation, diffusion]
|
||||
sources:
|
||||
- arxiv:2607.09024
|
||||
---
|
||||
|
||||
# 视频生成预训练
|
||||
|
||||
## 定义
|
||||
|
||||
**视频生成预训练**是 GenCeption 提出的核心范式:将大规模文本到视频生成作为计算机视觉的通用预训练策略。这是 NLP 中 next-token prediction 的视觉等价物。
|
||||
|
||||
## 核心主张
|
||||
|
||||
视频生成预训练**独特地满足**通用视觉预训练的 [[three-imperatives-vision|三大必要条件]]:
|
||||
|
||||
1. **时空演化**:生成高保真视频序列迫使模型内化 3D 几何、物体恒存性和物理交互
|
||||
2. **视觉-语言对齐**:模型原生以文本为条件,提供内在的多模态对齐
|
||||
3. **规模化**:由于标注成本低和商业价值高,现代视频生成模型已在大规模数据和计算上训练
|
||||
|
||||
## 与现有预训练范式的对比
|
||||
|
||||
| 范式 | 时空先验 | VL 对齐 | 规模化 | 代表方法 |
|
||||
|------|---------|---------|--------|----------|
|
||||
| MAE / VideoMAE | 弱 | 无 | 受限 | Masked Autoencoder |
|
||||
| DINO / DINOv2 | 无 | 无 | 中等 | Self-Distillation |
|
||||
| CLIP / SigLip | 无 | 强 | 强 | Contrastive Learning |
|
||||
| V-JEPA | 弱 | 无 | 受限 | Feature Prediction |
|
||||
| **视频生成预训练** | **强** | **强** | **强** | GenCeption |
|
||||
|
||||
## NLP 类比
|
||||
|
||||
> 就像 next-token prediction 内化了语法、语义和世界知识,视频帧生成内化了 3D 几何、物理学和视觉语义。
|
||||
|
||||
GenCeption 将视频扩散模型视为"基础模型",在其上进行多任务后训练——完全类比 LLM 的 pre-training → post-training 流程。
|
||||
|
||||
## 参考
|
||||
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
|
||||
- [[three-imperatives-vision|通用视觉预训练三条件]]
|
||||
- [[feed-forward-diffusion|前馈扩散]]
|
||||
Reference in New Issue
Block a user