受到自然语言处理、计算机视觉领域中基础模型的成功的启发,具身智能领域也在尝试设计、训练、微调大模型来解决现实生活中最普遍存在的机器人操作问题。本次分享主题为“Vision-language-action models for robot manipulation”,即面向机器人操作任务的视觉语言动作模型。本次分享介绍了机器人操作任务(robot manipulation)的重要性和挑战,梳理了近期比较典型的使用视觉语言动作模型(vision-language-action models)来解决这类任务的研究(RT-1, RT-2, RT-X, RT-H, OpenVLA, pi0, RDT, GR-2, DROID),并总结其中的要点、不足和未来工作。