继本周 LingBot-Depth、LingBot-VLA 及 LingBot-World 相继开源引爆社交网络后,今天,我们为大家奉上本次「蚂蚁灵波开源周」的收官之作:具身世界模型 LingBot-VA。
LingBot-VA 首次提出自回归视频-动作世界建模框架,将大规模视频生成模型的能力与机器人控制深度融合,模型在生成“下一步世界状态”的同时,直接推演并输出对应的动作序列,使机器人能够像人一样“边推演、边行动”,真正将世界模型的预测能力转化为物理世界的行动能力。
在多项真实机器人评测中,LingBot-VA 展现出对复杂物理交互的强适应能力,在成功率上显著超越了业界优秀的基线模型。