AI模型 | SANA-WM来了,开源视频世界模型卷到1分钟
巴黎铁塔下的小甲壳虫
2026年05月17日 16:13
NVIDIA培训

NVIDIA 这次放出的 SANA-WM,很可能会成为开源视频世界模型里的一个关键节点。原因很直接:2.6B 参数、原生支持 720p 的 one-minute 视频、还能做 metric-scale 6-DoF camera control,这套组合拳已经从“能演示”走到了“能研究、能部署、能迭代”。

如果只看 headline,很多人会把注意力放在 2.6B 参数上。真正重要的核心信息,其实是它把“长视频、高分辨率、单卡可用”这三个以前很难同时成立的条件,放进了同一个系统里。这比再堆几十亿参数更有现实意义,毕竟实验室和创业团队手里最常见的资源,通常是一两张卡,不是一个机房。

第一个关键点,是 SANA-WM 瞄准得很准。现有很多 open-source world model 卡在两个地方:要么 inference 需要 multi-GPU,研究复现门槛直接起飞;要么为了把算力预算压住,只能牺牲分辨率和时长,最后生成结果更像“会动的概念图”。SANA-WM 的目标明确,就是在不依赖大规模集群的前提下,完成 minute-long、high-resolution video 的训练与推理。

这件事的意义,不只是省钱。世界模型的价值本来就和时间长度强相关。几秒钟的视频,模型学到的是局部纹理运动和短时动态;一分钟的视频,模型必须处理场景连续性、相机轨迹、物体长期交互、遮挡后的重现这些更接近物理世界的问题。视频一长,很多“看起来懂世界”的模型就会露馅,前后逻辑开始漂。

第二个关键点,是它在 inference 侧给了三种单卡变体,这个设计很工程化。SANA-WM 提供 a bidirectional generator、a chunk-causal autoregressive generator、以及 a few-step distilled autoregressive generator。前者偏高质量离线合成,适合追求视觉效果和全局一致性的场景;中间这个偏顺序 rollout,更符合世界模型逐步展开未来状态的使用方式;distilled 版本则明显面向部署,速度更快。

这里最亮眼的是 distilled 版本的落地指标:借助 NVFP4 quantization,在单张 RTX 5090 上,34 seconds 完成 60-second 720p clip 的 denoising。这个数字的信号非常明确。开源视频模型开始进入“单机就能认真玩”的阶段。对研究者来说,这意味着可以更频繁地做 ablation、控制变量实验和数据迭代;对行业团队来说,这意味着 demo 不再必须绑定云端集群,边缘部署和本地工作站实验都更有想象空间。

第三个关键点,是 SANA-WM 真正解决的问题并长序列建模里的结构性瓶颈。处理 60-second、720p 视频时,它需要生成 961 latent frames。只要序列一拉长,标准 softmax attention 的 memory 和 compute complexity 就会按 quadratic 增长。这不是“再调调 batch size”能解决的小毛病,而是架构层面的扩展天花板。

很多同学第一次看到这里会觉得,attention 贵,那就换 linear attention 不就好了。事情没这么轻松。前代 SANA-Video 用的是 cumulative ReLU-based linear attention,这类方法的优点是 recurrent state 大小恒定,扩展到长序列很友好;问题也同样明显,因为缺少 decay mechanism,历史帧的信息会被持续累积,而且权重缺乏合理衰减。模型像一个过分念旧的人,十分钟前的一朵云和刚刚出现的转角路标,在内部状态里都挤得很靠前。到了 minute-scale sequences,上下文漂移几乎是必然结果。

第四个关键点,是 SANA-WM 用 frame-wise Gated DeltaNet,也就是 GDN,替换了大多数 attention blocks。这一步很有研究味道。GDN 在 language models 里常见的是 token-wise 形式,按 token 递推;视频这里改成 frame-wise 变体,每个 recurrent step 处理一个完整的 latent frame。这个改法很自然,因为视频生成里更关键的状态单位往往是帧级结构,而不是单个 token 的局部关系。

更重要的是 GDN update rule 里引入了 decay g。这个衰减门控几乎就是为长视频漂移量身定做的。模型在递推过程中会主动控制历史信息保留多少、遗忘多少,从而避免所有过去帧被一股脑堆进当前状态。对于世界模型来说,这种“有记忆,也会遗忘”的机制非常关键。真实世界的动态本来就不是均匀加权的历史回放,近期状态通常更决定下一步演化,远期状态则需要压缩成更抽象的环境记忆。

这里我想下一个明确判断:SANA-WM 的价值,首先体现在序列建模范式上,其次才是视频观感。很多开源项目发布时,大家最容易被 sample 吸引,盯着画面够不够炸裂;真正能改变赛道演进速度的,通常是底层机制是否让更多人复现、扩展、部署。SANA-WM 把 DiT、单卡 inference、frame-wise GDN、6-DoF camera control 放进同一套开源系统,说明开源世界模型开始从“秀结果”进入“拼体系”。

接下来我更看好的方向有两个。一个是 world model 和 embodied AI 的结合会更紧,尤其是带 camera control 的生成能力,会吸引更多机器人、自动驾驶、仿真训练方向的研究者参与。另一个是长视频模型会继续向更强的 recurrent architecture 倾斜,因为一分钟只是起点,真正有用的世界模型需要更长时间尺度上的稳定 rollout。

我的预测很简单:SANA-WM 不会是终点,但会成为一个分水岭。开源视频世界模型从这一刻起,竞争焦点会越来越集中在长时一致性、单卡部署效率和可控相机运动。参数量当然还会涨,真正决定下一轮格局的,已经是架构设计能不能把“长视频世界感”做扎实。显卡会继续发热,研究也会继续升温,这次两边都挺合理。

———

觉得有用的话,点赞收藏关注三连支持一下

每天分享AI前沿动态,欢迎关注