20260720
This commit is contained in:
41
concepts/sim-to-real-transfer-vision.md
Normal file
41
concepts/sim-to-real-transfer-vision.md
Normal file
@@ -0,0 +1,41 @@
|
||||
---
|
||||
title: "Sim-to-Real 视觉迁移 (Sim-to-Real Transfer in Vision)"
|
||||
created: 2026-07-13
|
||||
updated: 2026-07-13
|
||||
type: concept
|
||||
tags: [computer-vision, transfer-learning, sim-to-real, generalization]
|
||||
sources:
|
||||
- arxiv:2607.09024
|
||||
---
|
||||
|
||||
# Sim-to-Real 视觉迁移
|
||||
|
||||
## 定义
|
||||
|
||||
GenCeption 中展示的关键涌现行为:**仅用合成人类视频训练的模型,能够泛化到真实世界视频和分布外(OOD)物体类别**(动物、机器人等)。
|
||||
|
||||
## 现象
|
||||
|
||||
GenCeption 的训练数据:
|
||||
- 800 RenderPeople 3D 资产 + 200 CMU motion capture 动作
|
||||
- 7,500 段合成人类视频
|
||||
- 仅覆盖人类
|
||||
|
||||
测试泛化:
|
||||
- ✅ 真实世界人类视频
|
||||
- ✅ 动物(猩猩、狗等)
|
||||
- ✅ 拟人化角色
|
||||
- ✅ 机器人
|
||||
|
||||
## 为什么重要
|
||||
|
||||
这暗示**视频生成预训练内化了远比表面外观更深层的通用视觉先验**——可能是 3D 几何理解、运动规律、物体结构等跨类别共享的表示。合成数据训练的"人类专用模型"实际上学到了"通用视觉理解"。
|
||||
|
||||
## 与其他工作的区别
|
||||
|
||||
- 传统 sim-to-real:需要 domain randomization、domain adaptation 等技术
|
||||
- GenCeption:零样本泛化——预训练的视频生成 backbone 提供的表示已经足够通用
|
||||
|
||||
## 参考
|
||||
- [[genception-video-vision-2026|GenCeption (ECCV 2026)]]
|
||||
- [[video-generation-pretraining|视频生成预训练]]
|
||||
Reference in New Issue
Block a user