1.3 KiB
1.3 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| Sim-to-Real 视觉迁移 (Sim-to-Real Transfer in Vision) | 2026-07-13 | 2026-07-13 | concept |
|
|
Sim-to-Real 视觉迁移
定义
GenCeption 中展示的关键涌现行为:仅用合成人类视频训练的模型,能够泛化到真实世界视频和分布外(OOD)物体类别(动物、机器人等)。
现象
GenCeption 的训练数据:
- 800 RenderPeople 3D 资产 + 200 CMU motion capture 动作
- 7,500 段合成人类视频
- 仅覆盖人类
测试泛化:
- ✅ 真实世界人类视频
- ✅ 动物(猩猩、狗等)
- ✅ 拟人化角色
- ✅ 机器人
为什么重要
这暗示视频生成预训练内化了远比表面外观更深层的通用视觉先验——可能是 3D 几何理解、运动规律、物体结构等跨类别共享的表示。合成数据训练的"人类专用模型"实际上学到了"通用视觉理解"。
与其他工作的区别
- 传统 sim-to-real:需要 domain randomization、domain adaptation 等技术
- GenCeption:零样本泛化——预训练的视频生成 backbone 提供的表示已经足够通用