为了适配机器人任务,现有VLA模型需要在数量有限的task-specific的数据集上微调,但现有微调范式会覆盖预训练模型中的泛化知识,这导致模型并没有真正“听懂话”,无法泛化到未见指令。本研究指出这一缺陷的根源在于 VLA 数据集的模态不平衡性:语言指令的多样性远低于视觉和动作,这种不平衡促使模型学习“视觉捷径”,优先依赖视觉特征预测动作而忽略语言指令。为此,本研究提出了 BayesVLA, 从贝叶斯分解的角度将VLA 策略分解为视觉‑动作先验(VA Prior)和语言条件似然(VLA Likelihood)在贝叶斯框架下实现“先看后做,再通过指令细化”(Seeing to Act, Prompting to Specify),从结构上缓解模态不平衡和灾难性遗忘,并结合信息论理论证明了视觉捷径的存在及分解方法的有效性。针对机器人物体操作交互的特性,本研究基于pre-contact和post-contact提出了对应的实现。在LIBERO-PRO, 自建仿真benchmark,以及大量真机实验中,相比于Pi0.5,BayesVLA显著提高了对未见指令、物体和环境的泛化能力。
工作相关链接:
1. 主页:https://xukechun.github.io/papers/BayesVLA/
2. 论文链接:https://arxiv.org/pdf/2512.11218
3. 代码链接:https://github.com/xukechun/BayesVLA