本次分享我们邀请到了中国科学技术大学三年级直博生朱皓怡为大家介绍他们团队的工作SANA-WM:分钟级单卡可部署高效世界模型。
世界模型正在成为具身智能、机器人仿真与交互式环境中的关键基础能力,但现有长视频世界模型往往依赖大模型、大规模数据和多 GPU 推理,难以在较低成本下实现长时程、高分辨率、可控生成。为此,NVIDIA 提出了 SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer,这是一个面向分钟级视频生成的开源世界模型,能够根据首帧图像、文本描述和 6-DoF 相机轨迹,生成 60 秒、720p、相机运动可控的视频世界。模型通过 Hybrid Linear DiT 架构结合 Gated DeltaNet 与 softmax attention,在保持长上下文建模能力的同时显著降低计算与显存开销;同时引入双分支相机控制机制,利用 UCPE 与 Plücker ray 条件增强轨迹跟随精度。SANA-WM 还构建了包含约 21.3 万条带度量尺度相机位姿标注的视频数据集,并使用两阶段生成与长视频 refiner 提升画质和时序一致性。实验结果表明,SANA-WM 在 1 分钟世界模型评测中实现了更强的相机控制精度,并能在单 GPU 上完成分钟级视频生成,为高效、可扩展的具身仿真与世界模型研究提供了新的技术路径。