本次分享我们邀请到了刘志豪为大家介绍他们团队的工作STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning,刘志豪目前是北京中关村学院与中科院自动化所联培的博士生,师从清华于超老师与中科院自动化所范国梁老师。研究方向为具身智能与多智能体强化学习。
STEAM 是一套面向真实世界机器人学习的、无需人工标注的帧级优势 估计框架。针对真实机器人数据中常见的停顿、纠错、失败和次优行为混杂问题,STEAM 利用专家轨迹中帧对之间的归一化时间偏移作为自监督信号,训练多个 temporal-offset 预测器,并将其预测结果转化为衡量局部任务进展的优势分数。为提高对混合质量 rollout 数据的鲁棒性,STEAM 采用集成模型中的最小优势值进行保守评分,从而更可靠地识别有效推进、失败回退与恢复过程。在双臂毛巾折叠、薯片结账、可乐补货和单臂抓取放置等真实机器人任务中,STEAM 能够有效发现低质量片段,并在结合 CFGRL 后显著提升策略成功率,相较基线方法分别带来 59%、54.3%、23% 和 16.2% 的性能提升。
更关键的是,STEAM 的优势分数不只是一个事后评价指标,而是能直接定位轨迹内部哪些片段值得学习。以毛巾折叠为例,专家演示大多数时间保持高优势值,必要的重试只会造成短暂下探;成功 rollout 的优势值整体更低且波动更大,说明它虽然在推进任务,但动作更慢、更犹豫;失败 rollout 在进入错误状态后迅速跌到零附近,并长时间无法恢复;人工纠错轨迹则先出现类似失败的下降,随后在人类接管后重新回升。这说明 STEAM 能在同一条轨迹中区分“有效推进”“停滞失败”和“纠错恢复”,因此比轨迹级成功/失败标签更适合处理真实机器人数据的混杂质量问题。
在策略训练阶段,这种帧级优势被进一步转化为最优性条件,用来引导 CFGRL 更偏向学习高质量片段。实验结果表明,STEAM 的收益并不只来自专家数据本身,而来自它对专家演示、人工纠错和自主 rollout 的统一筛选:在毛巾折叠、薯片结账和可乐补货等长流程任务上,随着训练数据从专家演示扩展到纠错数据和完整混合数据,成功率持续提升;在短流程 pick-and-place 上,单独过滤专家数据反而可能因样本过少带来轻微下降,但加入完整混合数据后仍能获得最好结果。这说明 STEAM 更像是一个数据质量调度器:它不是简单扩大数据量,而是在扩大数据覆盖的同时抑制低质量行为对策略的干扰。