Files
myWiki/concepts/sim-to-real-transfer-vision.md
2026-07-20 14:14:55 +08:00

42 lines
1.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "Sim-to-Real 视觉迁移 (Sim-to-Real Transfer in Vision)"
created: 2026-07-13
updated: 2026-07-13
type: concept
tags: [computer-vision, transfer-learning, sim-to-real, generalization]
sources:
- arxiv:2607.09024
---
# Sim-to-Real 视觉迁移
## 定义
GenCeption 中展示的关键涌现行为:**仅用合成人类视频训练的模型能够泛化到真实世界视频和分布外OOD物体类别**(动物、机器人等)。
## 现象
GenCeption 的训练数据:
- 800 RenderPeople 3D 资产 + 200 CMU motion capture 动作
- 7,500 段合成人类视频
- 仅覆盖人类
测试泛化:
- ✅ 真实世界人类视频
- ✅ 动物(猩猩、狗等)
- ✅ 拟人化角色
- ✅ 机器人
## 为什么重要
这暗示**视频生成预训练内化了远比表面外观更深层的通用视觉先验**——可能是 3D 几何理解、运动规律、物体结构等跨类别共享的表示。合成数据训练的"人类专用模型"实际上学到了"通用视觉理解"。
## 与其他工作的区别
- 传统 sim-to-real需要 domain randomization、domain adaptation 等技术
- GenCeption零样本泛化——预训练的视频生成 backbone 提供的表示已经足够通用
## 参考
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
- [[video-generation-pretraining|视频生成预训练]]