1.9 KiB
1.9 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | ||||
|---|---|---|---|---|---|---|---|---|---|
| 统一任务表示 (Unified Task Representation) | 2026-07-13 | 2026-07-13 | concept |
|
|
统一任务表示
定义
GenCeption 的统一任务表示策略将所有视觉感知任务的输出映射到共享的表示空间,使得单一架构和权重可以处理多种异构任务——仅通过文本 prompt 切换任务模态,无需架构修改。
两大策略
稠密任务:统一到 3 通道 RGB 空间 [0,1]
| 任务 | 映射方式 |
|---|---|
| 深度估计 | 单通道复制到 RGB 三通道 |
| 表面法向 | 三个方向分量 = RGB 三通道 |
| 前景分割 | 单通道复制 |
| DensePose | 语义 UV 坐标 → RGB |
| 相机姿态 | [[rothko-raymap |
稀疏任务:可学习 Token + MLP
2D/3D 关键点等结构化输出不适用于 RGB 映射。解决方案:
- 附加 T 个可学习 token 到视频 latent(每个视频帧一个)
- 经过 DiT 处理后,MLP 将每个 token 解码为 K 维目标
- 使用 3D RoPE + 位置插值维持与预训练的时间边界兼容
设计哲学
类似于将非文本数据格式化为文本字符串以供 LLM 处理,我们主张将视觉任务直接投影到连续像素空间——这是预训练视觉先验的最佳利用域。
关键含义
任务规范从架构修改转移到数据格式设计:
- 旧范式:新任务 → 新 head / 新 decoder / 新 loss
- GenCeption:新任务 → 设计数据表示格式(如何将输出映射到 RGB 或 token),架构和损失函数保持不变
这使得模型可以随视觉任务谱系的不断扩展而规模化。