
Linum v2 的性能瓶颈主要源于其庞大的注意力上下文窗口。处理一段 720p、5 秒的视频片段需消耗高达 110K 个 token,而大型语言模型预训练中 97% 的样本 token 数少于 8K。鉴于注意力计算成本呈二次方增长,缩减上下文窗口成为加速训练的关键。
主流生成式图像和视频系统多基于潜在扩散模型(LDM),将压缩与生成分解为变分自编码器(VAE)和扩散 Transformer(DiT)两个独立模块。然而,近期出现的像素空间模型 JiT 展现出替代潜力,它将两者合并,允许扩散模型构建专用于生成的潜在空间,而非依赖主要用于重建的 VAE 潜在空间。
尽管 JiT 在压缩率上表现优异,但在细粒度细节生成上存在短板。为此,团队提出了一种新的编码器-解码器架构 JiT-DDT。该架构不仅恢复了图像细节,更显著提升了训练效率:与 Linum v2 基线相比,JiT-DDT 训练文本到图像模型所需的 GPU 小时数减少了 3.6 倍,且生成图像的像素数量是前者的 4 倍。
触及 VAE 压缩墙
几乎所有生成式图像和视频模型均采用 LDM 架构,包含负责压缩的 VAE 和负责生成的 DiT。由于直接在原始像素上操作成本过高,VAE 将 RGB 像素压缩为低维 token 供 DiT 使用。在 LDM 训练过程中,VAE 被冻结,潜在空间保持静态。
为控制 DiT 中的注意力成本,业界试图最大化 VAE 的压缩率。然而,包括 FLUX、Ideogram 和 Z-Image 在内的主流开源模型,其压缩上限均停留在 16×16。实验表明,在使用标准 CNN VAE 且不牺牲重建质量的前提下,压缩率存在经验上限。
统一模型与维度诅咒
李天虹和何恺明提出的 JiT 论文通过抛弃 VAE,将压缩任务完全交给 DiT,实现了 32×32 的 token 压缩。尽管这种方法看似能无损降低注意力成本,但早期尝试往往失败。2025 年初的研究指出,DiT 难以从高维输入中学习,这并非架构固有缺陷,而是源于广泛使用的 v-prediction 和 v-loss 流匹配目标。
在流匹配中,神经网络需预测速度场。随着维度增加,拟合噪声的问题呈指数级困难,即“维度诅咒”。JiT 研究发现,在高维空间中,只有 x-prediction 能准确生成样本。通过切换至 x-prediction 并结合 v-loss,团队成功规避了维度诅咒,解锁了激进分块化和高通道维度的应用潜力。
JiT-DDT:解耦扩散 Transformer
为解决 JiT 在细粒度细节生成上的不足,团队引入了 DDT(解耦扩散 Transformer)理念,构建了 JiT-DDT 架构。DDT 将模型分为“条件编码器”和“速度解码器”,前者专注于低频结构,后者专注于高频细节。
JiT-DDT 的核心创新在于:
- x-prediction 驱动的结构学习:编码器预测输入图像的低分辨率版本(如 64×64),显式学习结构信息,并将隐藏状态传递给解码器。
- 解耦架构:编码器和解码器大小相等,解码器接收文本条件和结构草图,专注于全分辨率图像的细节恢复。
- 辅助损失优化:采用 PixelREPA 辅助损失,通过掩码视觉 token 并与 DINOv3 表示对齐,加速 DiT 收敛。
此外,团队还调整了噪声调度,并引入单流主干、SwiGLU 激活函数、Moon optimizer 以及 Qwen 文本嵌入等技术优化,进一步提升了模型性能。
效果评估与局限
对比测试显示,JiT-DDT 在艺术风格一致性和光照真实性上优于 Linum v2,且避免了过饱和问题。然而,在图像焦点外的人物面部生成等复杂细节上,JiT-DDT 仍存在挑战。团队认为,通过延长训练时间、重新平衡数据集或引入 DPO 后训练,这些问题有望得到解决。
从技术演进来看,JiT-DDT 与 Self-Flow、RAE v2 等研究殊途同归,均旨在通过在网络早期引入损失项或对齐机制,解决 DiT 早期层结构学习缓慢及梯度传播问题,从而加速模型收敛并提升生成质量。