传统零样本 VLN agent依赖在线局部观测决策,导致探索低效、多选项歧义等关键问题。SpatialNav 首次提出 “预探索 + 全局空间建模” 的零样本设定:通过构建空间场景图(SSG)将环境的层级结构、语义标签与空间关系显式编码,突破了纯在线感知的框架束缚。其创新的 Agent-centric 空间图、指南针式视觉图与远程目标定位三大组件,让零样本首次具备长程空间推理能力。
论文题目:SpatialNav: Leveraging Spatial Scene Graphs for Zero-ShotVision-and-Language Navigation