--- title: "Sim-to-Real 视觉迁移 (Sim-to-Real Transfer in Vision)" created: 2026-07-13 updated: 2026-07-13 type: concept tags: [computer-vision, transfer-learning, sim-to-real, generalization] sources: - arxiv:2607.09024 --- # Sim-to-Real 视觉迁移 ## 定义 GenCeption 中展示的关键涌现行为:**仅用合成人类视频训练的模型,能够泛化到真实世界视频和分布外(OOD)物体类别**(动物、机器人等)。 ## 现象 GenCeption 的训练数据: - 800 RenderPeople 3D 资产 + 200 CMU motion capture 动作 - 7,500 段合成人类视频 - 仅覆盖人类 测试泛化: - ✅ 真实世界人类视频 - ✅ 动物(猩猩、狗等) - ✅ 拟人化角色 - ✅ 机器人 ## 为什么重要 这暗示**视频生成预训练内化了远比表面外观更深层的通用视觉先验**——可能是 3D 几何理解、运动规律、物体结构等跨类别共享的表示。合成数据训练的"人类专用模型"实际上学到了"通用视觉理解"。 ## 与其他工作的区别 - 传统 sim-to-real:需要 domain randomization、domain adaptation 等技术 - GenCeption:零样本泛化——预训练的视频生成 backbone 提供的表示已经足够通用 ## 参考 - [[genception-video-vision-2026|GenCeption (ECCV 2026)]] - [[video-generation-pretraining|视频生成预训练]]