Day100-A|内存高效超高分辨率图像生成、文生视频大模型Vidu等|Wed
AIGC_Research
2024年05月09日 04:01
收录于文集
共1篇

本文为简略版,完整版内容请通过微信公众号AIGC Research浏览查阅!


Image Generation|Memory-Efficient, Face, Drop-in LoRA

Inf-DiT: Upsampling Any-Resolution Image with Memory-Efficient Diffusion Transformer

2024-05-07|THU, Zhipu.AI|⭐️🟡

http://arxiv.org/abs/2405.04312v1

概述

本文提出了一种名为Inf-DiT的新型图像上采样模型,旨在解决生成超高分辨率图像时内存消耗巨大的问题。传统扩散模型在生成4096×4096等超高分辨率图像时,内存需求呈二次方增长,导致实际生成的图像分辨率通常限制在1024×1024以内。Inf-DiT通过创新的单向块注意力机制(UniBA),在推理过程中动态调整内存开销,同时处理全局依赖性,显著提高了图像上采样的分辨率。

方法

Inf-DiT模型采用单向块注意力(UniBA)算法,将图像分割成块并顺序生成,每个批次同时产生一部分块,从而将空间复杂度从O(N^2)降低到O(N)。UniBA算法通过限制每个块仅依赖于少数几个直接邻近块,实现了块之间的单向生成依赖,形成了一个有向无环图(DAG)。此外,模型还引入了全局图像嵌入邻近低分辨率(LR)块的交叉注意力机制,以增强全局和局部一致性

实验

通过在HPDv2和DIV2K数据集上的实验,Inf-DiT在机器和人类评估中均展现出了生成超高分辨率图像的SOTA性能。与常用的UNet结构相比,Inf-DiT在生成4096×4096图像时能够节省超过5倍的内存。量化比较结果显示,Inf-DiT在多个指标上超越了其他高分辨率生成模型。人类评估进一步证实了Inf-DiT在细节真实性、全局一致性和与低分辨率输入的一致性方面的优势。此外,模型还成功地展示了通过自身迭代上采样生成高分辨率图像的能力。


Diffusion-driven GAN Inversion for Multi-Modal Face Image Generation

2024-05-07|Yonsei U, LG Electronics, QMUL, KIST|CVPR 2024|⭐️🟡

http://arxiv.org/abs/2405.04356v1

概述

本文提出了一种新的多模态面部图像生成方法,该方法能够将文本提示和视觉输入(如语义掩码或涂鸦图)转换为逼真的面部图像。研究者通过结合生成对抗网络(GANs)和扩散模型(DMs)的优势,利用DM中的多模态特征来丰富预训练GAN的潜在空间。该方法通过一个简单的映射网络和一个风格调制网络来链接两个模型,并将特征图和注意力图中的有意义表示转换为潜在代码。通过GAN反演,估计的潜在代码可以用来生成2D或3D感知的面部图像。

方法

研究者提出了一种将预训练的GAN(如StyleGAN和EG3D)和DM(如ControlNet)链接起来进行多模态面部图像生成的新方法。通过一个简单的映射网络,将DM的潜在空间与GAN的潜在空间相连接,同时使用基于注意力的风格调制网络来利用与多模态输入相关的有意义特征。此外,提出了一种多去噪步骤的训练策略,增强了模型捕获多模态输入的文本和结构细节的能力。该模型可以应用于2D和3D感知的面部图像生成,无需额外数据或损失项,并在性能上超越了现有的基于DM和GAN的方法。

实验

通过使用预训练的2D和3D GANs,研究者验证了所提方法的有效性。在CelebAMask-HQ数据集上进行的实验中,使用文本提示和语义掩码进行多模态面部图像生成任务,与现有的方法相比,所提方法在多个评估指标上均显示出更好的性能。此外,还进行了消融研究,以验证映射网络和风格调制网络的有效性,并通过定量和定性结果展示了这些组件对提高生成图像质量和一致性的贡献。研究者还探讨了该方法在3D面部风格迁移任务中的潜力和局限性,并提出了未来工作的方向。


Simple Drop-in LoRA Conditioning on Attention Layers Will Improve Your Diffusion Model

2024-05-07|SNU, KRAFTON, Yonsei U|⭐️🟡

http://arxiv.org/abs/2405.03958v1

概述

本研究探讨了在扩散模型的U-Net架构中,通过在注意力层添加低秩适应(LoRA)条件化来提升图像生成质量的方法。当前最先进的扩散模型通常采用U-Net结构,包括卷积层和自注意力层。这些模型在处理图像时,会根据时间嵌入输入类别或标题嵌入输入进行条件化,但这种条件化通常只影响卷积层,而不直接作用于注意力层。研究者们提出,这种设计选择虽有效,但不对注意力层进行条件化似乎有些武断,可能不是最优解

方法

文章提出了一种新方法,通过联合训练多个LoRA适配器和基础模型,有效条件化U-Net架构中扩散模型的注意力层。这些LoRA适配器被称为TimeLoRA和ClassLoRA用于离散时间设置,以及统一组合LoRA(UC-LoRA)用于连续信噪比(SNR)设置。研究者们展示了简单地以插件方式添加这些LoRA适配器,无需修改或调整原始模型的其他部分,就能在多个流行模型和数据集上一致性地提高FID分数。

实验

实验部分,研究者们在不同的数据集上实施了LoRA条件化,包括CIFAR-10、FFHQ 64x64和ImageNet,使用了不同的扩散模型,如nano diffusion、IDDPM和EDM。实验结果表明,添加LoRA条件化可以显著提高图像生成的质量,同时只增加了大约10%的参数。此外,研究还发现,即使不使用卷积层的规模和移位条件化,仅使用LoRA条件化在注意力层上也能达到与基线相当的FID分数。这表明LoRA条件化是一种有效的机制,可以在不增加太多计算成本的情况下提升模型性能。


Image|Scene Text Image & Disentangled Representation

Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing

2024-05-07|USTC|CVPR 2024|⭐️

http://arxiv.org/abs/2405.04377v1

概述

本文提出了一种名为DARLING(Disentangled Representation Learning framework)的新方法,旨在改善场景文本识别、编辑和移除任务的性能。传统的方法通常使用紧密耦合的特征来处理所有任务,但这种方法在处理特定任务时存在性能瓶颈。DARLING通过将场景文本图像中的样式信息(如字体、背景)和内容信息(如字符、纹理)分离开来,使得模型能够根据不同任务的需求选择性地利用这两种特征。

方法

DARLING的核心思想是将风格和内容特征解耦,并针对它们设计了不同的监督信号。研究者首先合成了一对具有相同风格但不同内容的图像数据集,然后通过设计的监督机制来解耦这两种特征。具体来说,内容特征通过文本识别损失进行监督,而风格特征则通过一个对齐损失来确保图像对中的风格特征保持一致。此外,风格特征还被用于通过图像解码器重构图像对中的风格,从而有效地基于它们的独特属性解耦特征。

实验

在实验部分,作者展示了DARLING在多个公开数据集上的性能,包括场景文本识别、编辑和移除任务。结果表明,DARLING在这些任务上均达到了最先进的性能。特别是在场景文本识别任务上,与使用相同参数的其他最先进方法相比,DARLING的平均准确率超过了0.5%。此外,作者还进行了消融研究,验证了所提解耦训练范式和门控注入策略的有效性。尽管使用合成数据的方法存在与真实数据的领域差距问题,但DARLING仍然展示了其在场景文本任务中的潜力和优势。


Video Generation|Text-to-Video, Motion Editing

Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

2024-05-07|THU, ShengShu|⭐️⭐️

https://www.shengshu-ai.com/vidu

https://arxiv.org/abs/2405.04233

概述

Vidu 是一个高性能的文本到视频生成器,能够生成高达1080p分辨率、长达16秒的单个生成视频。它基于扩散模型,采用U-ViT作为其骨干网络,这使得Vidu能够处理长视频并具备可扩展性。Vidu在生成连贯、动态的视频方面表现出色,能够创造出既逼真又富有想象力的内容,并初步理解一些专业摄影技术,如转场、摄像机运动、光影效果和情感表达(更多/完整生成案例见纯享版推文或查看原论文)

方法

Vidu首先使用视频自动编码器降低视频的空间和时间维度,以提高训练和推理的效率。然后,它利用U-ViT作为噪声预测网络来模拟这些压缩表示。U-ViT将压缩后的视频分割成3D块,将所有输入(包括时间、文本条件和带噪声的3D块)视为token,并在Transformer的不同层之间使用长跳跃连接。通过利用Transformer处理可变长度序列的能力,Vidu能够处理不同时长的视频。

实验

Vidu在大量文本-视频对上进行训练,并通过训练一个高性能的视频标题生成器来自动标注所有训练视频,以解决人工标注不可行的问题。在推理过程中,Vidu应用重新标注技术将用户输入改写为更适合模型的形式。此外,Vidu还在其他可控视频生成方面进行了初步实验,包括边缘到视频的生成、视频预测和主题驱动的生成,所有这些都展示了有希望的结果。与目前最强大的文本到视频生成器Sora相比,Vidu在某些方面的表现相当。(更多/完整生成案例见纯享版推文或查看原论文)


Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing

2024-05-07|Xidian|⭐️

http://arxiv.org/abs/2405.04496v1

概述

本文提出了一种名为Edit-Your-Motion的视频运动编辑方法,该方法能够在不改变视频内容和背景的情况下,根据文本提示或参考视频控制源视频中对象的运动。该技术对于多媒体领域的广告、艺术创作和电影制作等具有重要价值,它允许用户轻松修改视频中对象的运动,而无需复杂的软件。

方法

Edit-Your-Motion采用一次性视频运动编辑方法,仅需要单个文本-视频对进行训练。该方法设计了详细提示引导学习策略(DPL),通过两个训练阶段分离空间-时间扩散模型中的空间和时间特征第一阶段通过洗牌视频帧和掩蔽背景来学习空间特征(对象内容的特征),同时提出循环因果注意力(RC-Attn)学习对象的一致内容特征第二阶段恢复视频帧的时间关系,学习时间特征(背景和对象运动的特征),并采用噪声约束损失来平滑帧间差异。在推理阶段,通过双分支结构(编辑分支和重建分支)将源对象的内容特征注入编辑分支。

实验

通过在野外视频上的实验,Edit-Your-Motion展示了其优越性。定性实验表明,该方法能够准确控制运动并保留源视频中对象的内容和背景。定量实验使用自动评估和人类评估,结果显示Edit-Your-Motion在所有指标上均优于其他比较方法。此外,消融研究验证了所提模块的有效性,例如RC-Attn比稀疏注意力更好地建立了整个序列的内容一致性,而噪声约束损失(NCL)影响了帧间平滑度,导致背景在帧间不一致。


3D Generation|Multi-View Diffusion

MVDiff: Scalable and Flexible Multi-View Diffusion for 3D Object Reconstruction from Single-View

2024-05-06|Oxford VGG, ICL(Imperial)|⭐️

http://arxiv.org/abs/2405.03894v1

概述

本文提出了一种名为MVDiff的新型多视图扩散模型,旨在从单视图图像中生成一致的多视图图像,以用于3D对象重建。现有的图像到3D的扩散模型在生成一致的多视图图像方面存在挑战,通常将3D表示融入扩散模型会降低模型的速度、泛化能力和质量。MVDiff通过结合场景表示Transformer和视图条件扩散模型,并引入极线几何约束和多视图注意力机制,以加强3D一致性。

方法

MVDiff框架首先定义了一个场景变换Transformer(SRT),用于从一组输入视图中学习隐式3D表示。然后,给定输入视图及其相对相机姿态,使用视图条件扩散模型估计目标视图的条件分布。该模型利用自注意力和多视图注意力在UNet中学习几何对应关系,通过极线几何约束来加强图像间的交互。此外,该模型采用视图条件扩散模型来生成新视图,并通过自注意力块确保不同视图间的一致性

实验

在实验部分,作者使用了Objaverse数据集训练模型,并在Google Scanned Objects(GSO)数据集上进行了测试。评估指标包括PSNR、SSIM和LPIPS用于新视图合成,以及Chamfer Distances和3D IoU用于单视图或少视图的3D重建。实验结果表明,MVDiff在新视图合成和3D重建的质量上超越了现有的基线方法,尤其是在使用多个参考视图时性能提升显著。此外,作者还进行了消融实验,以评估极线注意力和多视图注意力对模型性能的影响,并讨论了合成数据在医学领域的潜在应用和伦理考量。