[Lumina Talk 第40期] STEAM:无需人工标注的时序集成优势建模,让真实世界机器人学习更进一步!

737
1
2026-07-16 11:32:04
25
投币
39
7
本次分享我们邀请到了刘志豪为大家介绍他们团队的工作STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning,刘志豪目前是北京中关村学院与中科院自动化所联培的博士生,师从清华于超老师与中科院自动化所范国梁老师。研究方向为具身智能与多智能体强化学习。    STEAM 是一套面向真实世界机器人学习的、无需人工标注的帧级优势 估计框架。针对真实机器人数据中常见的停顿、纠错、失败和次优行为混杂问题,STEAM 利用专家轨迹中帧对之间的归一化时间偏移作为自监督信号,训练多个 temporal-offset 预测器,并将其预测结果转化为衡量局部任务进展的优势分数。为提高对混合质量 rollout 数据的鲁棒性,STEAM 采用集成模型中的最小优势值进行保守评分,从而更可靠地识别有效推进、失败回退与恢复过程。在双臂毛巾折叠、薯片结账、可乐补货和单臂抓取放置等真实机器人任务中,STEAM 能够有效发现低质量片段,并在结合 CFGRL 后显著提升策略成功率,相较基线方法分别带来 59%、54.3%、23% 和 16.2% 的性能提升。 更关键的是,STEAM 的优势分数不只是一个事后评价指标,而是能直接定位轨迹内部哪些片段值得学习。以毛巾折叠为例,专家演示大多数时间保持高优势值,必要的重试只会造成短暂下探;成功 rollout 的优势值整体更低且波动更大,说明它虽然在推进任务,但动作更慢、更犹豫;失败 rollout 在进入错误状态后迅速跌到零附近,并长时间无法恢复;人工纠错轨迹则先出现类似失败的下降,随后在人类接管后重新回升。这说明 STEAM 能在同一条轨迹中区分“有效推进”“停滞失败”和“纠错恢复”,因此比轨迹级成功/失败标签更适合处理真实机器人数据的混杂质量问题。 在策略训练阶段,这种帧级优势被进一步转化为最优性条件,用来引导 CFGRL 更偏向学习高质量片段。实验结果表明,STEAM 的收益并不只来自专家数据本身,而来自它对专家演示、人工纠错和自主 rollout 的统一筛选:在毛巾折叠、薯片结账和可乐补货等长流程任务上,随着训练数据从专家演示扩展到纠错数据和完整混合数据,成功率持续提升;在短流程 pick-and-place 上,单独过滤专家数据反而可能因样本过少带来轻微下降,但加入完整混合数据后仍能获得最好结果。这说明 STEAM 更像是一个数据质量调度器:它不是简单扩大数据量,而是在扩大数据覆盖的同时抑制低质量行为对策略的干扰。
Lumina Embodied AI Community
Lumina Talk
(30/33)
自动连播
6.3万播放
简介
【Lumina Talk第1期】ICRA’25 最佳论文 | D(R, O) Grasp:全新交互式表征重塑跨智能体灵巧手抓取
48:27
【Lumina Talk第2期】Roboverse:面向可拓展可泛化机器人学习的统一平台、数据集和测试基准
01:05:45
【Lumina Talk 第5期】RoboTwin 2.0:强域随机化双臂仿真数据合成与评测基准
01:19:52
【Lumina Talk 第8期】VLA-OS: 揭秘机器人VLA模型的第一性原理
45:52
【Lumina Talk 第9期】AgiBot World: 具身智能专家数据全新认知
49:32
【Lumina Talk 第10期】InstructVLA: 视觉-文本-动作指令微调,从理解到操作
53:55
【Lumina Talk 第11期】MinD:双系统世界模型,赋能实时机器人操作规划
51:20
【Lumina Talk 第12期】Hitter: 分层框架赋能机器人乒乓球技术
53:23
【Lumina Talk 第15期】TrajBooster: 通过轨迹学习增强人形VLA全身操作能力!
31:35
【Lumina Talk 第18期】上交穆尧ScaleLab专场:离散扩散范式VLA、解耦路由的协同式MoE、半自动数据采集与生成框架
53:44
【Lumina Talk第3期】UniVLA: 构建通用可扩展的机器人动作空间
54:30
【Lumina Talk第4期】TesserAct:首个通用4D世界模型
01:09:41
【Lumina Talk 第19期】西湖大学王东林老师MiLab专场:全构型VLA模型基座、强化学习与灵巧操作
02:18:12
【Lumina Talk 第20期】斯坦福大学迮炎杰:构建通用具身智能的数据基石
01:07:29
【Lumina Talk 第21期】清华许华哲老师TEA Lab专场: 迈向可部署的强化学习训练系统
01:25:08
【Lumina Talk 第22期】RynnVLA-002:统一具身VLA模型和世界模型
51:45
【Lumina Talk 第23期】WholeBodyVLA:面向人形机器人移动操作的全身VLA框架
52:47
TM-20260116141659-944402327-recording-1_screen
01:13:18
【Lumina Talk 第25期】Project Instinct | 一个统一的人形机器人直觉智能的训练和部署测试框架
01:06:41
【Lumina Talk 第26期】BayesVLA:贝叶斯因式分解,破解语言泛化难题
01:17:10
【Lumina Talk 第27期】InternVLA-A1:“虚实结合、融会贯通”的具身操作大模型
01:26:12
【Lumina Talk 第27期】RLinf真机系列工作:WoVA, RL-Co, USER
01:39:42
【Lumina Talk 第28期】PointWorld:面向机器人的3D世界模型
01:29:36
【Lumina Talk 第30期】RISE:在“想象”中提升真机能力
01:15:48
【Lumina Talk 第32期】通研院人形机器人专场 | OmniXtreme, OmniTrack, OmniClone and TacThru
SparseVideoNav
50:54
GuideVLA
01:02:16
UniT剪辑
56:30
[Lumina Talk 第38期] SANA-WM:分钟级单卡可部署高效世界模型
35:09
[Lumina Talk 第40期] STEAM:无需人工标注的时序集成优势建模,让真实世界机器人学习更进一步!
45:46
[Lumina Talk 第39期] RoboNaldo:让人形机器人踢出又准又稳又有力的射门
59:16
[Lumina Talk 第41期] EventVLA:基于关键事件记忆的长程操作VLA模型
49:50
[Lumina Talk 第42期] SIM1:让仿真扎根物理世界,规模化推进机器人学习
54:18
客服
顶部
赛事库 课堂 2021拜年纪