1.8 KiB
1.8 KiB
title, created, updated, type, tags, sources
| title | created | updated | type | tags | sources | ||||
|---|---|---|---|---|---|---|---|---|---|
| 扩散特征提取 (Diffusion as Feature Extractor) | 2026-07-13 | 2026-07-13 | concept |
|
|
扩散特征提取
定义
将预训练扩散模型(特别是 DiT)重新定义为视觉特征提取器而非生成器。这是 GenCeption 和一系列相关工作共用的核心思想。
原理
扩散模型在去噪过程中学会了对视觉世界的丰富内部表示(geometry、texture、physics、object relations)。这些表示可以被提取并用于感知任务,而非仅用于图像/视频生成。
GenCeption 将其形式化为 feed-forward-diffusion——t=0、velocity 取反、单步 forward。
相关工作谱系
| 工作 | 模型 | 任务 | 关键贡献 |
|---|---|---|---|
| Marigold | Stable Diffusion | 单目深度 | 首个证明图像扩散→深度估计可行 |
| GenPercept | 图像扩散 | 稠密感知 | 系统性研究特征注入/解码/训练目标 |
| Diception | 图像扩散 | 多任务感知 | 文本引导的任务切换 |
| BufferAnytime | 图像扩散+时序层 | 视频深度/法向 | 时序一致性 |
| DepthCrafter | 视频扩散 | 深度 | CLIP/DINO 对齐 |
| GenCeption | 视频扩散 | 通用视频感知 | 统一架构+前馈改造 |
核心设计问题
- 用哪些层:GenCeption 仅用最后一层(与 VAE decoder 原生对齐)
- 时间步选择:t=0 对应生成终点,噪声最小,信息最丰富
- 输出格式:velocity 取反后与 VAE decoder 兼容