ECCV 2026 | AgentVLN:让机器人导航进入Agent时代

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

ECCV 2026 | AgentVLN:让机器人导航进入Agent时代
AI技术研报 2026-09-10 15:18
+5982 阅读

近年来,视觉语言模型(Vision-Language Model, VLM)在图像理解、语义推理等任务中展现出了强大的能力。然而,当这些模型真正进入物理世界,让机器人根据一句自然语言指令完成自主导航时,仍然面临巨大挑战。


例如,机器人完成一句简单的指令:


“穿过走廊,在窗户旁边找到椅子。”


机器人不仅需要 “理解” 这句话,还需要知道:“走廊在哪里? 窗户和椅子之间是什么空间关系?当前视角是否被遮挡?应该先往哪里移动?接近目标时如何避免碰撞?”  这就是视觉语言导航(Vision-and-Language Navigation, VLN)面临的核心问题:如何让智能体将自然语言指令转化为现实世界中的连续行动。


为此,AgentVLN 提出 “VLM-as-Brain” 的理念,让 VLM 负责高层认知决策,同时通过模块化技能库完成具体执行,从而实现更加高效、灵活的机器人导航,即:VLM Agent → Skill Calling → SLAM/Perception → Robot Navigation。


论文提出的 AgentVLN 在 R2R-CE 和 RxR-CE 等主流 VLN 基准上取得领先性能,同时仅使用 3B 规模模型,并支持 Jetson 等边缘设备实时运行。 该成果已被计算机视觉顶级会议 ECCV 2026 (European Conference on Computer Vision)录用。


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


  • 论文标题:AgentVLN: Towards Agentic Vision-and-Language Navigation
  • 代码链接:https://github.com/Allenxinn/AgentVLN
  • 项目主页:https://allenxinn.github.io/AgentVLN/
  • 数据集链接:https://huggingface.co/datasets/allenxinn/AgentVLN-Instruct


核心思路


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


AgentVLN 使得机器人不再要求一个巨大模型直接完成所有事情,而是让视觉语言模型负责:“理解任务目标、分析环境与调度不同技能”。 而具体执行,例如建地图、避障、移动和定位等功能则交给专门设计的技能模块完成。该工作将导航过程建模为部分可观测半马尔可夫决策过程,并将技能划分为感知层技能和规划层技能,让智能体根据环境状态动态调用不同能力。这种设计类似人类完成导航任务的方式:


看到环境 → 思考路线 → 行动 → 根据反馈调整。


机器人不需要每一步都重新学习,而是像人一样调用已有能力。同一个 AgentVLN “大脑”,可以根据不同机器人的身体能力,替换对应的底层技能模块,从而快速适配不同机器人平台。


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


通过插件式底层技能库设计,AgentVLN 可以在不重新训练大规模视觉语言模型的情况下,通过扩展或替换技能实现对新环境和新任务的适应。


把 3D 世界 “翻译” 为 VLM 能看懂的 2D 提示


视觉语言模型最大的优势,是理解二维图像中的语义信息。 但机器人导航的问题在于:真实世界是三维的。机器人需要知道:“应该往哪里走?”,而 VLM 看到的是:“图片里的哪个位置代表目标方向?”,如何连接这两个空间,一直是机器人自主导航领域的重要挑战。


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


为此,AgentVLN 提出:跨空间表示映射机制(Cross-space Representation Mapping)。其核心思想是:先利用 SLAM 作为感知技能计算真实环境中的可行路径,再将三维路径信息映射回二维图像空间,让 VLM 直接在视觉空间中进行决策。


机器人首先调用感知技能,对当前环境进行分析:1)构建三维空间地图;2) 获取环境拓扑结构;3)计算可通行区域;4)生成候选导航路径点。 随后,AgentVLN 利用相机模型,将这些三维可行路径点投影到当前摄像头视角下的二维图像中。最终,原本复杂的三维路径规划问题,被转换为:


“在图像中选择最符合语言指令的路径点。”


也就是说,模型不再需要直接从开放空间中预测一个精确坐标,而是将:开放性的精细点坐标生成问题(open-ended coordinate generation)转化为:基于视觉提示的路径选择问题(choice-based selection)


这种方式充分发挥了 VLM 强大的视觉语义理解能力,同时避免其直接进行复杂三维几何推理。该机制通过将感知层计算得到的三维路径点投影到二维图像平面,生成像素级对齐的视觉提示,使 VLM 能够直接在视觉空间中选择符合指令的路径,并进一步恢复为三维导航控制信息。


上下文驱动的自我纠错机制


现实物理环境下,机器人可能遇到:“家具遮挡、光线变化;摄像头看不到目标;行进过程中产生误差。” 如果机器人一直按照原计划前进,小错误可能不断累积,最终导致完全偏离目标。


因此,AgentVLN 加入了上下文驱动的自我纠错机制。当机器人发现:当前路线不可见;或者环境和指令不匹配;它不会盲目前进,而是主动执行探索动作:转身观察; 调整方向; 搜索新的路径。 


该机制能够在遮挡、盲区以及轨迹偏移情况下生成细粒度探索动作,从而减少长期导航中的误差累积。


主动调用感知技能补足空间信息


AgentVLN 提出 Query-Driven Perceptual Chain-of-Thought(QD-PCoT),让机器人具备 “主动获取信息” 的能力。其核心思想是:


当模型无法确定目标位置时,不再盲目预测,而是主动提出问题,并调用感知技能补充缺失信息。


当机器人无法判断椅子的距离时,会主动询问:


“前方椅子距离我有多远?”


随后调用深度感知模块获取空间信息,并结合反馈完成目标定位。相比直接回归目标坐标的方法,QD-PCoT 将导航过程转变为:


主动提问 → 获取信息 → 更新认知 → 决策行动


从而赋予机器人类似人类的 “自我认知” 能力,使其能够判断 “自己缺少什么信息”,并主动调用相应技能完成补充。论文实验表明,引入 QD-PCoT 后,AgentVLN 在无需增加额外参数的情况下进一步提升导航性能,有效缓解二维视觉中的深度歧义问题。


VLN 模型的端侧部署


很多先进视觉语言模型参数规模巨大,需要依赖云端服务器推理计算。AgentVLN 选择轻量化路线,采用 Qwen2.5-VL-3B 作为核心底座模型,并通过模块化设计避免额外的大规模三维视觉模块,实现了在 Jetson 边缘设备上的本地运行。


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


AgentVLN 不仅在多个 VLN 基准测试中超过已有方法,同时保持较小参数规模。研究团队将系统部署在四足机器狗、人形机器人平台上,通过摄像头获取环境信息,再利用感知技能完成地图构建和路径规划。


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


ECCV 2026 | AgentVLN:让机器人导航进入Agent时代


结语


AgentVLN 让机器人不再依赖一个庞大的端到端模型解决所有问题,而是赋予 VLM “大脑” 的角色:负责理解任务、分析环境和决策规划,再通过技能调用连接 SLAM、定位和控制模块,完成真实世界中的自主行动。未来,随着大模型推理能力不断增强,以及机器人感知、运动和操作技能持续完善,机器人有望从 “被预先编程执行任务”,逐渐走向 “理解目标、自主规划、主动学习”,真正成为能够与物理世界交互的智能体。


文章来自于"机器之心",作者 "机器之心"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群