**RAE(Representation Autoencoder,表征自编码器)**出自谢赛宁团队(NYU)的 Diffusion Transformers with Representation Autoencoders(arXiv 2510.11690,ICLR 2026)。核心主张一句话:生成模型不必从零训练 tokenizer——冻结 DINOv2 等预训练表征模型作为 encoder,只训一个轻量 decoder 证明特征能还原成像素。DiT 在这个”语义丰富、不做压缩”的高维潜空间上收敛快 16–47×,ImageNet 256 上 FID 1.13。社区称之为”VAE 时代的终结”。

问题:生成模型的潜空间一直在另起炉灶

视觉领域长期存在两套互不相通的表征:

  • 理解侧:DINOv2、SigLIP 等自监督表征,语义结构极好——ImageNet linear probing 准确率 84.5%(DINOv2-B)
  • 生成侧:SD-VAE、VQGAN 的 latent,为重建损失和码本约束优化——同一评测下 SD-VAE 只有 8%

扩散与自回归模型都在后者上训练。潜空间语义贫乏,意味着生成模型必须在训练生成的同时重新学习语义结构——这是收敛慢、scaling 受限的隐性成本。VQ 路线还叠加量化瓶颈:codebook 容量封顶了信息保真度,LlamaGen 早已证明去掉量化层、直接回归连续 latent 就能大幅改善重建(见 Vector Quantization:从经典压缩到AI时代的核心技术深入解析SSL VQ训练:矢量量化赋能的自监督学习范式全解)。

为什么没人直接用 DINOv2 的特征做生成潜空间?因为一个默认假设:判别式表征只保留语义、丢弃低级细节,无法重建像素。RAE 证明这个假设是错的。

RAE 架构:冻结表征 + 辅助解码

RAE 的结构简单到近乎朴素:

组件设计
Encoder冻结的预训练表征模型:DINOv2 / SigLIP2 / MAE
Latent不压缩:256×256 图像 → 256 个 token,每 token 768–1024 维(对比 SD-VAE 的 f=8、4–16 通道)
Decoder可训练的 ViT,损失 = L1 + LPIPS + GAN

两个关键事实支撑整个方法:

  1. 重建反而更好:RAE 的 rFID 为 0.16(MAE-B encoder),SD-VAE 是 0.62。判别式表征并不缺低级细节——此前的”无法重建”只是没配上合适的 decoder。
  2. decoder 只是可解码性证明,不是管线必需品。训练 DiT 时只需要 encoder 输出的 latent;decoder 独立训练,仅在最终渲染生成结果时使用。这把”表征质量”与”解码能力”彻底解耦。

高维 latent 的三道坎

让 DiT 直接消费 768–1024 维 token 并不平凡,论文给出三个针对性设计:

  1. Width scaling:DiT 隐藏宽度 必须不小于 token 维度 ),否则线性投影造成信息瓶颈,模型不收敛。
  2. 维度依赖的 noise shift:高维潜空间的信噪比动态与像素空间、低维 VAE 空间都不同,扩散 noise schedule 需按维度平移修正——仅此一项 FID 从 23 降到 4.81。
  3. Noise-augmented decoding:decoder 训练时对输入 latent 加噪,弥合”干净编码分布”与”扩散模型带噪输出分布”之间的差距。细节解码被显式交给 decoder——这与 为什么说高频细节不是全部都能被“重建”,必须被“生成”? 的观点同构。

结果

  • ImageNet 256×256 类条件生成:FID 1.51(无引导)/ 1.13(CFG),明显超过原版 DiT XL/2 的 2.27,见 扩散模型生成的条件引导图像生成指标:FID 和 IS
  • 收敛加速 16–47×:达到同等 FID 所需训练量大幅下降——语义结构良好的潜空间让扩散学习事半功倍,这是”tokenizer 决定生成上限”论断的又一实证
  • tokenizer 侧零训练成本:encoder 直接继承基础模型的 scaling 红利

后续工作

  • Scaling Text-to-Image Diffusion Transformers with RAE(arXiv 2601.16208):把 RAE 扩展到 T2I,系统研究 decoder scaling,并在共享高维潜空间中统一文生图与视觉理解
  • RAE-AR: Taming Autoregressive Models with Representation Autoencoders(arXiv 2604.01545):RAE 潜空间上的自回归生成达到与 VAE 相当的竞争力,打通 AR 路线
  • 技术脉络:MAR 证明 AR 不需要 VQ → LlamaGen 解耦 tokenizer 与生成建模 → RAE 把 tokenizer 从”任务内学习”变为”复用基础模型表征”。与 2025年图像生成模型的核心技术路径MMDiT 深度拆解:多模态扩散Transformer的原理、实现与落地 描述的架构演进汇流

评注

RAE 的意义超出一个 tokenizer 改进:

  • 范式转变:类比 LLM——词表从不为生成任务专门训练,视觉生成的 latent 同样可以直接继承理解模型的成果。潜空间从”生成管线的附属品”变为”基础模型表征的下游消费者”
  • 理解与生成统一的基础设施:两套表征合一是多模态统一模型(理解 + 生成共享 backbone)的关键前置
  • 开放问题:高维不压缩 latent 推理开销更大;decoder 实际承担了大量细节”生成”而非”重建”;视频与多模态场景的扩展仍在早期

参考