用单个4B VLM搞定多任务多机器人 embodied导航!通用导航模型新范式 【机器人导航】【大模型】

11
0
2026-09-08 03:17:37
点赞
投币
收藏
分享
本期解读论文:LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation 作者:Light Origins Team 论文链接:https://arxiv.org/abs/2608.30935 核心亮点: 1. **全任务统一架构**:无需额外任务/机器人专属模块,单个紧凑的预训练VLM backbone同时支持指令跟随、目标物体搜索、动态目标跟踪三类主流导航任务,打破传统方案任务碎片化的局限 2. **创新双通道点选推理接口**:用图像平面点选作为空间推理的统一中间表示,可走区域点给出可行方向、目标点定位任务终点,保留VLM预训练空间推理能力的同时提供可解释的显式推理步骤 3. **高效的RVQ动作量化方案**:仅用3个VLM输出token即可解码10步连续SE(2)导航轨迹,兼具高精度连续控制和易优化的概率更新特性,不需要额外扩散规划器或专属动作头 4. **出色的跨域迁移能力**:在10个公开仿真数据集上取得优异性能,同时支持真实世界不同机器人、室外场景、动态目标的零样本迁移,验证了通用VLM做导航 backbone的可行性 技术要点: - **架构设计**:基于Qwen3-VL-4B-Instruct保留原始预训练架构,仅扩展词汇表加入点选位置token和RVQ动作token,所有输出都通过原生语言模型头生成 - **时序处理**:时序感知视觉历史压缩方案,在固定视觉token预算内同时保留近期细节和长周期上下文信息 - **训练流程**:采用分阶段训练策略,从具身推理预训练、DAgger监督微调再到在线强化学习,逐步对齐感知、推理与控制模块 - **自动标注方案**:设计了全自动双通道点选标注 pipeline,可自动将导航目标投影到统一的点选空间生成训练数据 #AI #大模型 #具身智能 # embodied导航 #VLM #机器人 #计算机视觉 #论文解读 #自动驾驶 #空间智能 --- 有感兴趣的论文可以在评论区留言,我们进行详细拆解!
熊粉+ai学习者,近期主打做ai论文解读播客视频,有感兴趣的论文欢迎评论区留言!
客服
顶部
赛事库 课堂 2021拜年纪