[Lumina Talk 第38期] SANA-WM:分钟级单卡可部署高效世界模型

342
0
2026-07-16 11:20:20
24
投币
18
3
本次分享我们邀请到了中国科学技术大学三年级直博生朱皓怡为大家介绍他们团队的工作SANA-WM:分钟级单卡可部署高效世界模型。 世界模型正在成为具身智能、机器人仿真与交互式环境中的关键基础能力,但现有长视频世界模型往往依赖大模型、大规模数据和多 GPU 推理,难以在较低成本下实现长时程、高分辨率、可控生成。为此,NVIDIA 提出了 SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer,这是一个面向分钟级视频生成的开源世界模型,能够根据首帧图像、文本描述和 6-DoF 相机轨迹,生成 60 秒、720p、相机运动可控的视频世界。模型通过 Hybrid Linear DiT 架构结合 Gated DeltaNet 与 softmax attention,在保持长上下文建模能力的同时显著降低计算与显存开销;同时引入双分支相机控制机制,利用 UCPE 与 Plücker ray 条件增强轨迹跟随精度。SANA-WM 还构建了包含约 21.3 万条带度量尺度相机位姿标注的视频数据集,并使用两阶段生成与长视频 refiner 提升画质和时序一致性。实验结果表明,SANA-WM 在 1 分钟世界模型评测中实现了更强的相机控制精度,并能在单 GPU 上完成分钟级视频生成,为高效、可扩展的具身仿真与世界模型研究提供了新的技术路径。
Lumina Embodied AI Community
Lumina Talk
(29/33)
自动连播
6.3万播放
简介
【Lumina Talk第1期】ICRA’25 最佳论文 | D(R, O) Grasp:全新交互式表征重塑跨智能体灵巧手抓取
48:27
【Lumina Talk第2期】Roboverse:面向可拓展可泛化机器人学习的统一平台、数据集和测试基准
01:05:45
【Lumina Talk 第5期】RoboTwin 2.0:强域随机化双臂仿真数据合成与评测基准
01:19:52
【Lumina Talk 第8期】VLA-OS: 揭秘机器人VLA模型的第一性原理
45:52
【Lumina Talk 第9期】AgiBot World: 具身智能专家数据全新认知
49:32
【Lumina Talk 第10期】InstructVLA: 视觉-文本-动作指令微调,从理解到操作
53:55
【Lumina Talk 第11期】MinD:双系统世界模型,赋能实时机器人操作规划
51:20
【Lumina Talk 第12期】Hitter: 分层框架赋能机器人乒乓球技术
53:23
【Lumina Talk 第15期】TrajBooster: 通过轨迹学习增强人形VLA全身操作能力!
31:35
【Lumina Talk 第18期】上交穆尧ScaleLab专场:离散扩散范式VLA、解耦路由的协同式MoE、半自动数据采集与生成框架
53:44
【Lumina Talk第3期】UniVLA: 构建通用可扩展的机器人动作空间
54:30
【Lumina Talk第4期】TesserAct:首个通用4D世界模型
01:09:41
【Lumina Talk 第19期】西湖大学王东林老师MiLab专场:全构型VLA模型基座、强化学习与灵巧操作
02:18:12
【Lumina Talk 第20期】斯坦福大学迮炎杰:构建通用具身智能的数据基石
01:07:29
【Lumina Talk 第21期】清华许华哲老师TEA Lab专场: 迈向可部署的强化学习训练系统
01:25:08
【Lumina Talk 第22期】RynnVLA-002:统一具身VLA模型和世界模型
51:45
【Lumina Talk 第23期】WholeBodyVLA:面向人形机器人移动操作的全身VLA框架
52:47
TM-20260116141659-944402327-recording-1_screen
01:13:18
【Lumina Talk 第25期】Project Instinct | 一个统一的人形机器人直觉智能的训练和部署测试框架
01:06:41
【Lumina Talk 第26期】BayesVLA:贝叶斯因式分解,破解语言泛化难题
01:17:10
【Lumina Talk 第27期】InternVLA-A1:“虚实结合、融会贯通”的具身操作大模型
01:26:12
【Lumina Talk 第27期】RLinf真机系列工作:WoVA, RL-Co, USER
01:39:42
【Lumina Talk 第28期】PointWorld:面向机器人的3D世界模型
01:29:36
【Lumina Talk 第30期】RISE:在“想象”中提升真机能力
01:15:48
【Lumina Talk 第32期】通研院人形机器人专场 | OmniXtreme, OmniTrack, OmniClone and TacThru
SparseVideoNav
50:54
GuideVLA
01:02:16
UniT剪辑
56:30
[Lumina Talk 第38期] SANA-WM:分钟级单卡可部署高效世界模型
35:09
[Lumina Talk 第40期] STEAM:无需人工标注的时序集成优势建模,让真实世界机器人学习更进一步!
45:46
[Lumina Talk 第39期] RoboNaldo:让人形机器人踢出又准又稳又有力的射门
59:16
[Lumina Talk 第41期] EventVLA:基于关键事件记忆的长程操作VLA模型
49:50
[Lumina Talk 第42期] SIM1:让仿真扎根物理世界,规模化推进机器人学习
54:18
客服
顶部
赛事库 课堂 2021拜年纪