
文章主要内容和创新点主要内容本文提出了OpenNav,一种零样本视觉-语言导航框架,旨在解决开放世界中机器人的导航问题。该框架利用多模态大语言模型(MLLMs)的跨模态理解、代码生成和推理能力,结合开放词汇感知系统(OVPS)和经典规划技术,直接生成符合语言指令和场景几何约束的连续导航轨迹。OpenNav无需依赖预训练技能、运动原语或上下文示例,能处理“开放集物体”(如未预定义的各类物体)和“开放集指令”(如自由形式的自然语言指令)。通过多专家系统整合MLLMs与感知模型,生成2D鸟瞰图(BEV)价值图,融合语义知识与空间信息,再结合A*等经典规划算法优化轨迹,确保碰撞避免和指令对齐。实验在大规模自动驾驶数据集(如SemanticKITTI)和真实Husky机器人上验证了框架的有效性,展示了其在复杂户外场景中执行多样化导航任务的鲁棒性。创新点首个零样本户外导航框架:首次实现用MLLM直接生成户外导航轨迹,无需预训练技能、运动原语或上下文示例,支持开放集物体和指令。多专家系统设计:整合MLLMs与开放词汇感知系统,通过单一任务无关提示增强场景理解能力,提升对物体检测误差和语言歧义的鲁棒性。融合MLLM与经典规划:利用MLLM的推理和代码生成能力生成粗轨迹,结合经典规划技术(如A*)优化轨迹,兼顾语义对齐与几何合规性(如碰撞避免)。