

引言
在当前的视频生成模型研究中,普遍采用从头开始训练或增加时间层对文生图模型进行微调的方法。然而,这些研究往往过度侧重于时间和空间层的精确排序,而忽视了精选数据集重要性。已有的图像模型研究表明,在大型多样化数据集上进行预训练,并在较小但更高质量的数据集上进行微调可以显著提高模型性能。论文提出视频模型也应遵循此线路。
由此,论文提出了视频模型三步走策略:1)文生图预训练、2)大规模低分辨率视频数据预训练、3)小规模高质量数据集的高分辨率视频微调。文章还详细介绍了视频数据筛选方法(工作流)及其实证效果,表明精选数据集上的预训练模型性能相较未精选数据集模型有着显著提升,并可以在微调后依旧保持稳定。特别地,文章探讨了文生视频基础模型在小而高质量的数据上进行微调后,得到的高分辨率文生视频模型、图生视频模型和多视角3D合成等各类模型。
背景
本研究基于扩散模型的原理,构建了一种新型的视频潜在扩散模型(Video-LDMs)。与一般的时间混合层不同,本文采用Blattmann提出的架构,在每个空间卷积和注意力层之后加入时间卷积层和注意力层。这一方法构建了一个强大的通用运动表示先验模型,能够轻松微调为图生视频模型或多视角合成模型。文章还提出了帧率微调的概念,并采用EDM架构,将噪声schedule转为更高的噪声值。
数据精选与模型训练策略
在数据精选方面,本文提出了系统的方法和三步走的策略,涵盖了图像模型预训练、视频模型预训练和视频模型微调。数据处理和标注步骤包括基础数据筛选、动态视频检测、多种方式的视频描述生成和汇总。通过这些方法,构建了初始数据集LVD,并对其进行了进一步的处理。在图像模型预训练阶段,使用SD2.1模型在LVD数据集上训练了两个模型,显示出使用了预训练权重的模型明显更受人类欢迎。在精选视频预训练数据集阶段,通过人类偏好建立了适当的数据集,并使用不同的标注方法筛选出子集,以此训练模型并得到最佳阈值,并由此获得精选的预训练数据集LVD-F。最后在高质量微调阶段,微调了三个不同初始化的模型,并得出了视频模型分为预训练和微调更为有效的结论。
大规模训练视频模型
在大规模训练视频模型方面,论文详细介绍了基础模型的预训练、微调以及应用于不同任务的过程。基础模型的预训练基于SD2.1,强调了噪声schedule在高分辨率生成中的重要性。微调方面,研究团队对不同的任务进行了微调,包括文生视频、图生视频、帧插值预测和多视角3D重建。特别地,高分辨率图生视频模型的微调考虑了条件一致性和过饱和问题,并通过与其他视频模型的对比验证了其优越性。
结论
文章提出了稳定视频扩散(SVD)模型,并强调了预训练数据集精选的系统性方法和训练的三步走策略的重要性。通过这种方法,实现了大规模视频模型训练,包括基础模型的构建和五种不同任务的微调,展示了在视频生成领域的创新和进步。

Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
将潜在视频扩散模型扩展到大型数据集
摘要
我们介绍了稳定的视频扩散模型——一种用于高分辨率、最先进的文本到视频和图像到视频生成的潜在视频扩散模型。最近,针对2D图像合成训练的潜在扩散模型已经通过插入时间层并在小规模、高质量的视频数据集上微调,转变为生成式视频模型。然而,文献中的训练方法差异很大,该领域尚未就筛选视频数据的统一策略达成共识。在本文中,我们确定并评估了成功训练视频潜在扩散模型的三个不同阶段:文本到图像预训练、视频预训练和高质量视频微调。此外,我们展示了为生成高质量视频而需要一个经过精心筛选的预训练数据集的必要性,并提供了一个系统的筛选过程,以训练一个强大的基础模型,包括字幕和过滤策略。然后,我们探讨了在高质量数据上微调我们的基础模型的影响,并训练了一个与闭源视频生成相竞争的文本到视频模型。我们还展示了我们的基础模型为下游任务提供了强大的动态表示,如图像到视频生成,并适应了相机运动特定的LoRA模块。最后,我们证明了我们的模型提供了强大的多视角3D先验模型,并可作为微调多视角扩散模型的基础,以前馈方式联合生成对象的多个视角,在计算资源预算的一小部分上胜过基于图像的方法。我们在https://github.com/Stability-AI/generative-models 上发布了代码和模型权重。
1. 引言
受到扩散模型在生成图像建模方面的进展的推动,近年来在研究和实际应用中,在生成式视频模型方面取得了显著的进展。广泛来说,这些模型要么是从头开始训练,要么是通过插入额外的时间层从预训练的图像模型进行微调(部分或全部) 。通常,训练是在图像和视频数据集的混合上进行的。
虽然围绕视频建模的改进研究主要集中在空间和时间层的确切排列,但前述工作中没有一个调查数据选择的影响。这令人惊讶,尤其是考虑到培训数据分布对生成模型的重要影响是毋庸置疑的。此外,对于生成图像建模来说,众所周知,大型多样化数据集上进行预训练,并在较小但更高质量的数据集上进行微调可以显著提高性能。由于以前的许多视频建模方法已经成功地借鉴了图像领域的技术,因此值得注意的是,数据和训练策略的影响,即在较低分辨率下进行视频预训练和高质量微调的分离,尚未被研究。本研究直接探讨了这些以前未曾涉足的领域。
我们认为,尽管在规模化培训视频模型时,数据选择的重要贡献在当今的视频研究领域中受到了严重低估,但在从业者中已经得到了充分认可。因此,与以往的工作不同,我们依赖于简单的潜在视频扩散基线,其中我们固定了架构和训练方案,并评估了数据筛选的影响。为此,我们首先确定了三个不同的视频训练阶段,我们认为这对于良好性能至关重要:文本到图像的预训练、在低分辨率下对大规模数据集进行视频预训练,以及在较小但质量更高的视频数据集上进行高分辨率视频微调。借鉴大规模图像模型培训,我们介绍了一种系统的方法来大规模筛选视频数据,并对视频预训练期间数据筛选的影响进行了实证研究。我们的主要发现表明,在经过精心筛选的数据集上进行预训练可以显著提高性能,而这种提高在高质量微调之后仍然存在。
一个通用的运动和多视角先验模型。根据这些发现,我们将我们提出的筛选方案应用于一个包含大约6亿个样本的大型视频数据集,并训练一个强大的预训练文本到视频基础模型,提供了一个通用的运动表示。我们利用这一点,并在一个较小的、高质量的数据集上微调基础模型,用于高分辨率的下游任务,如文本到视频和图像到视频,在这些任务中,我们从单一的条件图像预测一系列帧。人类偏好研究表明,结果模型优于最先进的图像到视频模型。
此外,我们还展示了我们的模型提供了强大的多视角先验,并可以作为微调多视角扩散模型的基础,以一种前馈方式生成对象的多个一致视图,并胜过专门的新视图合成方法,如Zero123XL和 SyncDreamer 。
最后,我们展示了我们的模型允许通过明确提示时间层的运动线索以及通过在仅包含特定运动的数据集上训练LoRA模块 来进行明确的运动控制,这些模块可以有效地插入到模型中。
总之,我们的核心贡献有三个方面:(i) 我们提出了一个系统的数据筛选工作流程,将一个大型未筛选的视频集合转化为用于生成式视频建模的高质量数据集。利用这一工作流程,我们 (ii) 训练了最先进的文本到视频和图像到视频模型,胜过所有以前的模型。最后,我们 (iii) 通过进行特定领域的实验来探究我们模型中的强大运动和3D理解先验。具体来说,我们提供了证据,表明预训练的视频扩散模型可以变成强大的多视角生成器,这可能有助于克服通常在3D领域观察到的数据稀缺问题 。
2. 背景
最近的视频生成工作大多依赖于扩散模型 ,以共同合成从文本或图像条件生成的多个一致帧。扩散模型通过学习逐渐去噪化从正态分布中抽样得到的样本来实现迭代细化过程,并已成功应用于高分辨率的文本到图像和视频合成。
在这项工作中,我们遵循这一范式,对我们的视频数据集训练了一个潜在的视频扩散模型。在下一段,我们将简要概述利用潜在视频扩散模型(Video-LDMs)的相关工作;关于使用GANs 和自回归模型的方法的全面讨论可以在附录中找到。
潜在视频扩散模型 Video-LDMs 在计算复杂性较低的潜在空间中训练主要的生成模型 。大多数相关工作都利用了预训练的文本到图像模型,并在预训练架构中插入各种形式的时间混合层。Ge等人还依赖于时间相关的噪声,以增加时间一致性并简化学习任务。在这项工作中,我们遵循了Blattmann等人 提出的架构,并在每个空间卷积和注意层之后插入了时间卷积和注意层。与只训练时间层的工作 或完全不需要训练的工作 不同,我们对整个模型进行了微调。特别是在文本到视频合成中,大多数工作直接将模型条件设置为文本提示,或者利用额外的文本到图像先验。
在我们的工作中,我们采用了这种方法,并展示了所得模型是一个强大的通用运动先验模型,可以轻松微调为图像到视频或多视角合成模型。此外,我们引入了帧率上的微调 。我们还采用了EDM框架,并将计划明显转向了更高的噪声值,我们发现这对于高分辨率微调是至关重要的。
数据筛选 在大规模数据集上进行预训练对于强大的模型在多个任务中都是必不可少的,如区分性文本-图像和语言 建模。通过利用高效的语言-图像表示,如CLIP,数据筛选同样已成功应用于生成式图像建模 。然而,在视频生成领域,关于这类数据筛选策略的讨论在很大程度上缺失,处理和过滤策略以一种临时的方式引入。在公开可访问的视频数据集中,WebVid-10M 数据集尽管带有水印并且大小不理想,但一直是一个常用的选择 。此外,WebVid-10M 通常与图像数据一起使用 ,以进行联合图像-视频训练。然而,这增加了分离图像和视频数据对最终模型的影响的难度。为解决这些不足之处,本研究系统地研究了视频数据筛选方法,并进一步引入了用于生成式视频模型的通用三阶段训练策略,生成了一种最先进的模型。
3. 高质量视频合成的数据筛选
在本节中,我们介绍了一种在大规模视频数据集上训练最先进的视频扩散模型的通用策略。为此,我们 (i) 引入了数据处理和筛选方法,我们在第3.3节和第3.4节中系统地分析了这些方法对最终模型质量的影响,以及 (ii) 确定了用于生成式视频建模的三种不同的训练阶段。特别是,这些阶段包括:
• 阶段 I:图像预训练,即2D文本到图像扩散模型 。
• 阶段 II:视频预训练,对大量视频进行训练。
• 阶段 III:视频微调,对高分辨率的一小部分高质量视频上的模型进行精细调整。
我们分别在第3.2节到第3.4节中研究了每个阶段的重要性。
3.1数据处理和注释

我们收集了一个初始的长视频数据集,它构成了我们视频预训练阶段的基础数据。为了避免切换和淡入淡出影响到合成视频,我们以级联方式在三个不同的FPS级别上应用了一个切换检测流程。图2左侧提供了切换检测的必要性证据:在应用我们的切换检测流程后,我们获得了显著更多的剪辑(约为4倍),表明未经处理的数据集中的许多视频剪辑包含了超出元数据获得的切换。
接下来,我们使用三种不同的合成字幕方法为每个剪辑进行注释:首先,我们使用图像字幕生成器 CoCa对每个剪辑的中间帧进行注释,并使用 "V-BLIP" 获得视频字幕。最后,我们通过对前两个字幕进行基于LLM的总结来生成剪辑的第三个描述。
最终得到的初始数据集,我们称之为Large Video Dataset (LVD),包括5.8亿个带注释的视频剪辑对,总计212年的内容。
然而,进一步的调查揭示出,所得到的数据集包含可能会降低我们最终视频模型性能的示例,例如运动较少的剪辑、过多的文本存在或总体审美价值较低的剪辑。因此,我们额外使用密集的光流为数据集进行注释,我们以2 FPS计算光流,并通过移除平均光流幅度低于一定阈值的任何视频来过滤掉静态场景。事实上,当考虑LVD的运动分布(见图2,右图)时,通过光流分数,我们确定了其中一个接近静态的剪辑子集。此外,我们还应用光学字符识别来清除包含大量书面文本的剪辑。
最后,我们使用CLIP嵌入为每个剪辑的第一帧、中间帧和最后一帧进行注释,从中计算审美得分 以及文本-图像相似度。我们的数据集统计信息,包括总大小和剪辑的平均持续时间。

3.2. 阶段 I:图像预训练
我们将图像预训练视为我们训练流程的第一阶段。因此,与关于视频模型的并行工作一致,我们将我们的初始模型建立在一个预训练的图像扩散模型上,即 Stable Diffusion 2.1,以为其提供强大的视觉表示。
为了分析图像预训练的效果,我们在LVD的一个1000万子集上训练并比较了两个相同的视频模型,详细信息请参见附录D;其中一个使用了预训练的空间权重,另一个没有使用。我们使用人类偏好研究进行了这些模型的比较,如图3a所示,结果清楚地显示了图像预训练模型在质量和提示跟随方面都更受欢迎。
3.3. 阶段 II:筛选视频预训练数据集
一种系统性的视频数据筛选方法。对于多模态图像建模,数据筛选是许多强大的判别性和生成性模型的关键元素。然而,由于在视频领域没有同样强大的现成表示方法可用来过滤不想要的示例,因此我们依赖人类偏好作为信号来创建适当的预训练数据集。具体来说,我们使用下面描述的不同方法筛选LVD的子集,然后考虑在这些数据集上训练的潜在视频扩散模型的基于人类偏好的排名。
更具体地说,对于第3.1节引入的每种类型的注释(即CLIP分数、审美分数、OCR检测率、合成字幕、光流分数),我们从未经筛选的、随机抽样的LVD的大小为9.8M的子集LVD-10M出发,系统地去除底部的12.5%、25%和50%的示例。需要注意的是,对于合成字幕,我们无法以这种方式进行筛选。相反,我们评估了来自第3.1节的不同字幕方法的Elo排名。为了保持总子集数量的可管理性,我们将这个方案分别应用于每种类型的注释。我们在每个这些筛选子集上使用相同的训练超参数来训练模型,并对同一类注释的所有模型的结果使用Elo排名进行人类偏好投票的比较。基于这些投票,我们因此选择了每种注释类型的表现最佳的筛选阈值。这项研究的详细信息在附录E中呈现并讨论。将这种筛选方法应用到LVD会得到一个最终的预训练数据集,包括152M个训练示例,我们将其称为LVD-F,参见表1。

精选的训练数据提高了性能。在本节中,我们展示了上述数据筛选方法改善了我们视频扩散模型的训练。为了证明这一点,我们将上述筛选策略应用到LVD-10M上,并获得一个四分之一大小的子集LVD-10M-F。接下来,我们使用它来训练一个遵循标准架构和训练时间表的基线模型,并根据视觉质量和提示-视频对齐的人类偏好分数与在未筛选的LVD-10M上训练的模型进行比较。
我们在图3b中展示了结果,在这里我们可以看到筛选的好处:在这两个类别中,基于筛选的LVD-10M-F模型更受欢迎。为了进一步展示我们策展方法的有效性,我们将在WebVid-10M上训练的模型与LVD-10M-F上训练的类似视频模型进行了比较,后者是最受认可的研究许可数据集,以及InternVid-10M,后者专门用于高审美度的筛选。尽管LVD-10M-F也比这些数据集小四倍,但对比图4b显示,相应的模型在时空质量和提示对齐方面更受人类评估者青睐。
数据筛选在大规模情况下也有帮助。为了验证上述数据筛选策略在更大、更实际的相关数据集上同样有效,我们重复了上述实验,并在包含50M个示例的筛选子集上训练了一个视频扩散模型,以及相同大小的非筛选子集。我们进行了人类偏好研究,并在图4c中总结了这项研究的结果,在这里我们可以看到数据筛选的优势也在更多的数据情况下显现出来。最后,在图4d中我们展示了数据集大小也是在精选数据上训练时的一个关键因素,一个在50M个精选样本上训练的模型优于一个在相同步骤数下训练的LVD-10M-F模型。
3.4. 阶段 III:高质量微调
在前一节中,我们展示了系统性数据筛选对于视频预训练的有益影响。然而,由于我们主要关心的是在视频微调后优化性能,因此我们现在研究了阶段II后这些差异如何转化为阶段III后的最终性能。在这里,我们借鉴了潜在图像扩散建模的训练技巧,并提高了训练示例的分辨率。此外,我们使用了一个由高视觉保真度的250K个预标注视频剪辑组成的小微调数据集。
为了分析视频预训练对这个最后阶段的影响,我们微调了三个完全相同的模型,它们只在初始化时有所不同。我们将第一个模型的权重初始化为预训练的图像模型,跳过视频预训练,这是许多最近的视频建模方法中的常见选择。其余两个模型的权重初始化为前一节中的潜在视频模型的权重,具体来说,它们是在50M个策展和未策展的视频剪辑上训练的模型。我们对所有模型进行50K步的微调,并在微调早期(10K步)和最后进行人类偏好排名的评估,以衡量性能差异在微调过程中的进展。我们在图4e中展示了获得的结果,其中我们绘制了相对于排名最低的模型(从图像模型初始化)的用户偏好Elo改进。此外,
精选的预训练权重恢复的微调始终排名高于从未经筛选的训练中初始化的模型。
根据这些结果,我们得出结论:i) 在视频微调后,将视频模型训练分为视频预训练和视频微调对最终模型性能是有益的;ii) 视频预训练理想情况下应该在一个大规模的精选数据集上进行,因为在预训练后性能差异在微调后仍然存在。

4. 在大规模上训练视频模型
在本节中,我们借鉴了第3节的经验教训,并展示了在大规模上训练最先进的视频模型的结果。首先,我们使用从消融实验中得出的最佳数据策略来训练一个强大的基础模型,分辨率为320×576,详见附录D.2。然后,我们进行微调,以获得用于不同任务的几个强大的最先进模型,例如第4.2节的文本到视频,第4.3节的图像到视频,以及第4.4节的帧插值。最后,我们证明我们的视频预训练可以作为一个强大的隐式3D先验,通过在第4.5节上调整我们的图像到视频模型进行多视图生成,从而在多视图一致性方面胜过了同行的工作,特别是Zero123XL 和SyncDreamer 。
4.1. 预训练基础模型
正如在第3.2节中讨论的那样,我们的视频模型基于 Stable Diffusion 2.1(SD 2.1)。最近的研究表明,在训练图像扩散模型时采用噪声计划是至关重要的,随着分辨率的提高,需要更多的噪声。
作为第一步,我们通过在尺寸为256×384的图像上使用Karras等人提出的网络预调整方法,将我们图像模型的固定离散噪声计划微调为连续噪声。
在插入时间层后,我们在分辨率为256×384的14帧上对模型进行训练。我们使用标准的EDM噪声计划进行150k次迭代,批量大小为1536。
接下来,我们微调模型,以生成14个分辨率为320×576的帧,进行100k次迭代,批量大小为768。我们发现,在这个训练阶段,将噪声计划转向更多噪声是重要的,这证实了Hoogeboom等人对图像模型的结果。有关进一步的训练细节,请参见附录D。
我们将这个模型称为我们的基础模型,可以轻松进行微调以完成各种任务,正如我们在接下来的各节中所展示的。基础模型已经学到了一个强大的运动表示,例如,它在UCF-101上的零样本文本到视频生成任务中明显优于所有基线模型(表2)。评估细节可以在附录E中找到。


4.2. 高分辨率文本到视频模型
我们在一个高质量的视频数据集上对基础文本到视频模型进行微调,该数据集包含大约1百万个样本。数据集中的样本通常包含大量的物体运动,稳定的摄像机运动以及良好对齐的字幕,并且整体视觉质量很高。我们以576×1024的分辨率对基础模型进行了50,000次迭代的微调(再次将噪声计划转向更多噪声),批量大小为768。图5中显示了一些样本,更多样本可以在附录E中找到。
4.3. 高分辨率图像到视频模型
除了文本到视频,我们还对我们的基础模型进行了图像到视频生成的微调,其中视频模型接收一幅静态输入图像作为条件。因此,我们将馈送到基础模型的文本嵌入替换为条件的CLIP图像嵌入。此外,我们将条件帧的噪声增强版本按通道连接到UNet的输入中。我们不使用任何遮罩技术,只是将帧沿时间轴进行简单复制。我们微调了两个模型,一个预测14帧,另一个预测25帧;实施和训练细节可以在附录D中找到。
我们偶尔发现,标准的基于分类器的引导可能会导致图像伪影:引导过少可能导致与条件帧不一致,而引导过多可能导致过度饱和。
我们发现,与使用恒定引导尺度不同,沿着帧轴线性增加引导尺度是有帮助的。详细信息可以在附录D中找到。图5中显示了一些样本,更多样本可以在附录E中找到。
在第4.5节中,我们将我们的模型与最先进的、闭源的视频生成模型进行了比较,特别是GEN-2 和PikaLabs,并展示了我们的模型在视觉质量方面被人类投票者更喜欢。有关实验的详细信息以及更多的图像到视频样本可以在附录E中找到。

4.3.1 相机运动 LoRA
为了在图像到视频生成中促进受控的相机运动,我们在模型的时间注意块中训练了各种相机运动 LoRA 参数;请参见附录D以获取精确的实现细节。我们在一个带有丰富相机运动元数据的小数据集上训练这些额外的参数。特别地,我们使用了三个数据子集,其中相机运动被分类为“水平移动”、“缩放”和“静止”。在图7中,我们展示了相同条件帧的三个模型的样本;更多样本可以在附录E中找到。
4.4. 帧插值
为了获得高帧率的平滑视频,我们将我们的高分辨率文本到视频模型微调为帧插值模型。我们遵循Blattmann等人的方法,通过掩码将左帧和右帧连接到UNet的输入。该模型学会了在两个条件帧内预测三帧,有效地将帧率提高了四倍。令人惊讶的是,我们发现非常少量的迭代(约10k)就足以获得一个良好的模型。详细信息和样本可以在附录D和附录E中找到。
4.5. 多视角合成
为了同时获得一个对象的多个新视角,我们在多视角数据集上对我们的图像到视频SVD模型进行微调。
数据集。我们在两个数据集上对我们的SVD模型进行微调,其中SVD模型接收单个图像并输出多视角图像序列:(i) Objaverse 的一个子集,包含来自原始数据集的150K个经过筛选和CC许可的合成3D对象。对于每个对象,我们使用随机采样的HDRI环境映射和仰角在[-5◦,30◦]之间渲染了21帧的360◦轨道视频。我们在Google Scanned Objects (GSO)数据集中随机选择了50个对象,对生成的模型进行评估。和(ii) MVImgNet,包含一般家庭物品的随意捕获多视角视频。我们将视频分成约200K个训练视频和900个测试视频。我们将以纵向模式捕获的帧旋转到横向模式。Objaverse训练的模型还受限于输入图像的仰角条件,并以该仰角条件输出轨道视频。MVImgNet训练的模型不受姿态限制,可以在生成中选择任意相机路径。有关姿态条件机制的详细信息,请参见附录E。
模型。我们将我们微调的多视角模型称为SVD-MV。我们对SVD的视频先验在多视角生成中的重要性进行了消融研究。为此,我们将SVDMV的结果与从图像先验微调的结果(即文本到图像模型SD2.1 (SD2.1-MV))以及从随机初始化微调的结果(Scratch-MV)进行了比较。此外,我们还与当前最先进的多视角生成模型Zero123 、Zero123XL和SyncDreamer进行了比较。
指标。我们使用标准的峰值信噪比(PSNR)、LPIPS 和CLIP 之间的相应对地面实况和生成帧的相似性分数(CLIP-S)来评估50个GSO测试对象的性能。
训练。我们使用8个80GB的A100 GPU,在总批处理大小为16的情况下,对所有模型进行了12k步(约16小时)的训练,学习率为1e-5。
结果。图9(a)显示了GSO测试数据集上的平均指标。与SD2.1-MV和Scratch-MV相比,SVD-MV表现更好,明确证明了SVD模型中学到的视频先验在多视角生成中的优势。此外,与其他从SVD微调的模型一样,我们发现非常小数量的迭代(约12k)足以获得一个好的模型。此外,SVD-MV在训练时间上与最先进的技术相比具有竞争力(12k次迭代在16小时内完成),而现有模型通常需要更长时间的训练(例如,SyncDreamer专门在Objaverse上训练了四天)。图9(b)显示了不同微调模型的收敛性。在仅1k次迭代后,SVD-MV的CLIP-S和PSNR分数比其图像先验和无先验的对应模型好得多。图8显示了在GSO测试对象上的多视角生成结果的定性比较,图10则是在MVImgNet测试对象上的结果。正如您所看到的,我们生成的帧具有多视角一致性和逼真性。有关实验的更多细节以及更多多视角生成样本,请参见附录E。



5. 结论
我们提出了稳定视频扩散(SVD),一种用于高分辨率、最先进的文本到视频和图像到视频合成的潜在视频扩散模型。为了构建其预训练数据集,我们进行了系统性的数据选择和缩放研究,并提出了一种方法,用于策划大量视频数据,并将大规模且嘈杂的视频收藏转化为适用于生成式视频模型的数据集。此外,我们引入了视频模型训练的三个不同阶段,我们分别分析以评估它们对最终模型性能的影响。稳定视频扩散提供了一个强大的视频表示,我们可以通过微调视频模型来进行最先进的图像到视频合成以及其他高度相关的应用,如用于相机控制的LoRAs。最后,我们提供了有关视频扩散模型的多视角微调的先驱性研究,并展示了SVD构成了一个强大的3D先验,在多视角合成方面取得了最新的成果,同时仅使用了先前方法计算资源的一小部分。
我们希望这些发现对于生成式视频建模文献具有广泛的用途。关于我们工作的更广泛影响和局限性的讨论可以在附录A中找到。
参考:
https://static1.squarespace.com/static/6213c340453c3f502425776e/t/655ce779b9d47d342a93c890/1700587395994/stable_video_diffusion.pdf