Files
myWiki/concepts/video-generation-pretraining.md
2026-07-20 14:14:55 +08:00

1.8 KiB
Raw Blame History

title, created, updated, type, tags, sources
title created updated type tags sources
视频生成预训练 (Video Generation Pre-training) 2026-07-13 2026-07-13 concept
computer-vision
pre-training
video-generation
diffusion
arxiv:2607.09024

视频生成预训练

定义

视频生成预训练是 GenCeption 提出的核心范式:将大规模文本到视频生成作为计算机视觉的通用预训练策略。这是 NLP 中 next-token prediction 的视觉等价物。

核心主张

视频生成预训练独特地满足通用视觉预训练的 three-imperatives-vision

  1. 时空演化:生成高保真视频序列迫使模型内化 3D 几何、物体恒存性和物理交互
  2. 视觉-语言对齐:模型原生以文本为条件,提供内在的多模态对齐
  3. 规模化:由于标注成本低和商业价值高,现代视频生成模型已在大规模数据和计算上训练

与现有预训练范式的对比

范式 时空先验 VL 对齐 规模化 代表方法
MAE / VideoMAE 受限 Masked Autoencoder
DINO / DINOv2 中等 Self-Distillation
CLIP / SigLip Contrastive Learning
V-JEPA 受限 Feature Prediction
视频生成预训练 GenCeption

NLP 类比

就像 next-token prediction 内化了语法、语义和世界知识,视频帧生成内化了 3D 几何、物理学和视觉语义。

GenCeption 将视频扩散模型视为"基础模型",在其上进行多任务后训练——完全类比 LLM 的 pre-training → post-training 流程。

参考