大型视觉语言模型(VLMs)的最新进展提供了丰富的语义理解能力,使无人机能够通过自然语言指令搜索开放集物体。但现有工作通常要求无人机在等待高延迟的 VLM 推理时悬停,这会中断连续移动,从而限制搜索效率。此外,这些方法往往过度依赖 VLMs,仅基于最近的观测结果进行规划,由于 VLMs 有限的 3D 空间理解能力,导致搜索行为具有短视性。为了应对这些挑战,我们提出了 AirHunt,一个空中物体导航系统,能够在复杂的户外场景中平稳高效地导航以定位开放集物体。它具有异步架构,将 VLM 推理与路径规划解耦,在利用 VLM 的环境理解能力的同时实现连续飞行。此外,我们提出了一个选择性场景推理模块,该模块利用几何和语义冗余来实现有针对性的 VLM 查询,同时避免不必要的计算开销;还提出了一个语义感知的一致性规划模块,该模块在优先考虑与目标相关的潜在区域的同时,平衡区域间转换的时间成本。我们在各种物体导航任务和环境中对 AirHunt 进行了评估,结果表明,与最先进的方法相比,AirHunt 具有更高的成功率,更低的导航误差和更短的飞行时间。真实世界的实验进一步验证了 AirHunt 在复杂且具有挑战性的环境中的实际能力