PixelDiT:告别潜空间,英伟达联合罗切斯特大学发布像素级扩散Transfo
我爱计算机视觉
2025年12月02日 08:52
收录于文集
共499篇

  • 论文标题: PixelDiT: Pixel Diffusion Transformers for Image Generation

  • 论文作者: Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, Jiebo Luo

  • 作者机构: 英伟达;罗切斯特大学

  • 论文地址: https://arxiv.org/abs/2511.20645

最近,生成式AI的世界又迎来了一位重量级玩家。来自英伟达、罗切斯特大学的学者们联手,推出了一篇名为《PixelDiT: Pixel Diffusion Transformers for Image Generation》的论文,提出了一种全新的图像生成模型——PixelDiT

这个模型有点“返璞归真”的意思,它跳出了当前主流的潜空间(Latent Space)扩散模型的框架,选择了一条更直接、也更具挑战的道路:直接在像素空间(Pixel Space)中进行端到端的扩散学习。

结果相当惊艳,PixelDiT不仅在ImageNet 256x256图像生成任务上取得了1.61的卓越FID分数,大幅超越了现有的像素生成模型,并且在更高分辨率的文生图任务上,也表现出逼近顶级潜空间模型的强大实力。

为什么要重返像素空间?

熟悉图像生成的朋友们可能知道,自Stable Diffusion以来,基于潜空间的扩散模型(Latent Diffusion Models, LDMs)几乎成了业界的标配。这类模型,包括基于Transformer的DiT架构,通常会先用一个自编码器(Autoencoder)将高清图像压缩到一个更小、更易于处理的潜空间中,然后在潜空间里完成去噪和生成的核心步骤,最后再由解码器恢复成像素图像。

这个“压缩-生成-解压”的两阶段流程虽然计算效率高,但一直存在几个绕不开的问题:

  • 信息损失:自编码器的压缩是有损的,就像把一张高清照片存成一个低质量的JPG,一些精细的纹理和高频细节难免会丢失。这种损失是不可逆的,它限制了生成图像质量的上限。

  • 误差累积:由于自编码器和扩散模型是分开训练的,它们的目标并不完全一致。自编码器的“失真”可能会给后续的扩散模型带来额外的“噪音”,导致误差的累积。

  • 优化受限:两阶段的设计使得整个生成流程无法进行端到端的联合优化,潜力得不到充分释放。

在上图中,我们可以看到,基于潜空间的主流模型(如FLUX和Stable Diffusion 3)在编辑带有细小文字的图片时,由于VAE的重建缺陷,导致文字细节出现严重失真。相比之下,直接在像素空间操作的PixelDiT则能完美保留背景细节,展现了其在图像编辑任务中的巨大优势。

正是为了解决这些痛点,PixelDiT的研究者们决定“重返”像素空间,探索一种更纯粹、更直接的生成范式。

PixelDiT的核心设计:双层Transformer架构

直接在像素空间训练模型,最大的挑战就是计算量。一张256x256的图片就有超过6万个像素点,如果让Transformer对所有像素进行全局注意力计算,那计算成本将是天文数字。

为了在保证细节的同时控制计算开销,PixelDiT巧妙地设计了一种双层(Dual-Level)的Transformer架构。这个架构将图像生成任务解耦为两个不同层级的目标:全局语义的捕捉和局部纹理的精炼。

如上图所示,PixelDiT的整体框架由两个核心部分组成:

  • Patch-level DiT (高层):这一层负责“看全局”。它将图片切分成较大的图块(Patch),比如16x16的图块。这些图块令牌(Patch Token)数量不多,便于Transformer高效地捕捉图像的整体结构、布局和高级语义信息。

  • Pixel-level DiT (低层):这一层专注于“抠细节”。它在每个图块内部,对原始的像素令牌(Pixel Token)进行精细化建模,负责生成和修复图像的纹理、边缘等高频细节。

这两个层级各司其职又紧密协作,构成了一种高效且强大的像素扩散模型。为了让这个双层架构运转起来,研究者们还引入了两个关键的技术创新。

像素级自适应层归一化 (Pixel-wise AdaLN)

在扩散模型中,为了将时间步  和类别/文本条件  等信息融入模型,通常会使用自适应层归一化(AdaLN)。简单的AdaLN会对所有像素施加相同的调制参数,这显然无法满足像素级别的精细控制需求。

像素令牌压缩 (Pixel Token Compaction)

即便有了双层架构,在像素层进行全局注意力计算依然不现实。PixelDiT的另一个妙招是像素令牌压缩。在每个PiT块(Pixel Transformer Block)内部,它会先将一个图块内的所有像素令牌(例如16x16=256个)通过一个线性层压缩成一个紧凑的令牌(compact token),仅让这些 compact token 参与全局注意力以降低计算量,随后再将注意力结果扩展回各像素令牌,以保持细节信息。

这个“压缩-注意-扩展”的流程,有点像是一种临时的、可逆的“信息瓶颈”,它在不牺牲高频细节信息的前提下(因为有残差连接),将注意力计算的复杂度降低了  倍(为patch大小),使得在像素空间进行高效训练成为可能。

实验效果:像素级模型的惊人表现

PixelDiT的性能表现没有辜负其精巧的设计。在标准的ImageNet 256x256类别条件生成任务上,PixelDiT-XL模型取得了令人瞩目的成绩。

从上方的T2I性能对比表可以看出,在512x512和1024x1024分辨率的文生图任务中,PixelDiT-T2I的表现同样出色,GenEval分数分别达到了0.780.74,DPG-bench分数则为83.783.5。这些成绩不仅超越了其他像素空间模型,甚至已经非常接近甚至在某些指标上超过了像DALLE 3和SDXL这样的顶级潜空间模型。

上图展示了PixelDiT-XL在ImageNet上生成的一些样本,无论是物体的轮廓、纹理的清晰度,还是整体的结构,都展现了非常高的水准。

总结

PixelDiT的出现,无疑为图像生成领域注入了一股新的活力。它雄辩地证明了,通过巧妙的架构设计,直接在像素空间训练端到端的扩散模型是完全可行的,并且能够达到与主流潜空间模型相媲美甚至超越的性能。这种单阶段、无损的生成范式,不仅避免了自编码器带来的固有缺陷,也为未来更高保真度、更精细可控的图像生成和编辑技术打开了新的想象空间。