
论文标题: DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
论文作者: Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, Qi Tian
作者机构: 北京大学、南京大学、华为
论文地址: https://arxiv.org/abs/2511.19365
项目主页: https://zehong-ma.github.io/DeCo
代码仓库: https://github.com/Zehong-Ma/DeCo
最近,图像生成领域可以说是神仙打架,各种模型层出不穷。我们熟悉的扩散模型主要有两大流派:一个是在潜空间(Latent Space)里玩的,比如Stable Diffusion;另一个是直接在像素空间(Pixel Space)里“硬刚”的。
潜空间扩散模型虽然高效,但它的效果很大程度上受限于VAE(变分自编码器)的压缩和重建能力,有时候会产生一些意想不到的瑕疵。相比之下,端到端的像素扩散模型潜力更大,因为它直接和原始像素打交道,没有中间商赚差价。但它的缺点也很明显——训练和推理都太慢了,因为模型需要同时处理图像的低频语义(比如轮廓、结构)和高频细节(比如纹理、噪声),这让它有点“分身乏术”。
为了解决这个难题,来自华为等机构的研究者们提出了一个名为 DeCo 的新框架。DeCo 是 Decoupled Components 的缩写,意为“解耦的组件”,它的核心思想非常直观:让专业的模型做专业的事。

DeCo的高明之处就在于对这个过程进行了分解。

如上图(b)所示,DeCo不再让DiT独自承担所有工作,而是引入了一个轻量级的像素解码器(Pixel Decoder),实现了巧妙分工:

通过这样的分工,DiT从繁重的高频信号建模中解放出来,可以更好地捕捉语义,而像素解码器则高效地补充细节,整个流程变得更加高效和精准。

上图更详细地展示了DeCo的整体架构。DiT在降采样的输入上建模低频语义,而像素解码器则在DiT的语义指导下,利用全分辨率的输入来生成高频细节。
频域感知的Flow-Matching损失
为了让像素解码器更好地关注那些对人眼视觉重要的频率,同时忽略不重要的噪声,DeCo还引入了一个名为频率感知的Flow-Matching损失(Frequency-aware Flow-Matching Loss)。
这个方法借鉴了JPEG图像压缩的智慧。JPEG压缩时会使用一个“量化表”,这个表知道人眼对哪些频率信息更敏感。DeCo利用了这个先验知识,在计算损失时给不同频率的信号分配不同的权重。

解耦效果如何?
为了验证频率解耦的有效性,研究者们分析了DiT输出和最终预测的像素速度的DCT能量谱。

从上图可以清楚地看到,与基线模型相比,DeCo中DiT输出的高频能量(图上橙色线)被显著抑制,说明DiT确实更专注于低频信息了。而最终预测的像素速度中(图上蓝色线),高频能量得到了很好的保留,这证明了高频细节的生成任务被成功地转移到了像素解码器上。
DeCo的性能表现相当惊艳,可以说是实现了“快、好、省”的全面提升。
在ImageNet 256×256和512×512分辨率的类别到图像生成任务上,DeCo在端到端像素扩散模型中取得了SOTA性能,并且其结果已经可以和顶尖的两阶段潜空间扩散模型(如DiT、SiT)相媲美。

从上表可以看到,在256x256分辨率下,DeCo-XL/16的 FID达到了1.62,在512x512分辨率下,FID也达到了2.22,这两个指标在像素扩散模型中都是领先的,并且已经非常接近需要VAE的潜空间模型。
更重要的是训练效率的大幅提升。

DeCo仅用40万次迭代就达到了2.57的FID,比基线模型快了10倍,这无疑大大降低了像素扩散模型的训练成本。
在更具挑战性的文生图任务上,DeCo同样表现出色。在综合性基准测试GenEval上,DeCo取得了0.86的总体得分,超越了包括SD3、DALL-E 3在内的众多知名模型。

下面是一些由DeCo生成的样本,无论是类别生成还是文本生成,图像的质量和语义的准确性都非常高。

类别到图像生成 (256x256)

文本到图像生成 (512x512)
总的来说,DeCo通过一个简单而有效的频率解耦思想,为端到端像素扩散模型的发展开辟了一条新路。它不仅在性能上追赶上了潜空间模型,还在训练效率上实现了巨大飞跃,让我们看到了像素扩散模型在未来图像生成领域的巨大潜力。
你觉得这个“分而治之”的思路怎么样?欢迎在评论区留下你的看法!