当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。

具身智能正在经历模型能力竞赛:VLA 在 Scaling 的道路上一路狂奔,WAM 弥合未来预测和动作生成,RL 依靠 Reward Design 强化执行稳定性,TAMP 凭借严密的逻辑进行长序推理…
各个策略在擅长的任务上都有独特的优势,但真实世界往往同时要求高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。仰望 “通用具身模型”,只能长叹:“道阻且长”。
RoboHarness: 没有最强的模型,只有最合适的策略。
与其苦苦等待未来一个通用模型包办一切,不如问问:协同调用现有的控制策略,我们能做什么?
纵观具身智能技术历史长河上闪耀的星辰,VLA 擅长视觉语义理解与开放词汇指令,RL 在特定分布内具有稳定闭环行为,TAMP 擅长逻辑与几何规划,WAM 则通过预测未来辅助决策… 我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。
既然单一策略难以覆盖复杂任务的全部需求,为什么不让异构策略协同工作,在不同阶段各展所长?
RoboHarness 主要解决两个异构策略协同的关键难题: (1) 如何选择最适合的策略?(2) 异构策略间如何交接?它将 VLA、RL、TAMP 等控制策略封装为可调用技能,由 coding agent 进行高层任务拆解及子任务路由,并在相邻异构策略状态分布不兼容(Out of Distribution)时生成桥接轨迹。系统无需底层策略共享结构、动作空间或训练数据,也无需联合训练,可无痛接入新的底层控制策略,包括 WAM、VLN 或 MPC 等。

图 1|RoboHarness 总体框架。
RoboHarness 提供三类结构化辅助技能:Understanding Skills 调用一系列分析技能,从原始输入中提取更丰富的信息辅助决策;Memory Skills 检索相关的历史执行经验,显式重建下一控制策略熟悉的状态分布,并据此引导机器人进入该分布,实现不同策略之间的稳定交接;Evolution Skills 利用在线反馈更新策略元数据、参数与 Harness 逻辑。
第一步:识别策略的动态能力边界
策略能力边界并非固定不变,它受多种因素影响。VLA 在原始相机位姿下能够稳定执行的任务,在输入图片质量下降后可能会失败。系统需要判断,在当前场景、观测质量和机器人状态下,最有可能成功的控制策略是谁?RoboHarness 利用 Understanding Skills 从原始输入中,深入获取更丰富的信息(语义相似度、位姿不确定性、图像曝光等多维指标)刻画控制策略能力的边界,以辅助高层执行策略的选择。

图 2|不同扰动下的策略调用比例,以及 VLA 独立成功率与调用比例之间的关系。
表 1|LIBERO 与 LIBERO-Plus 成功率(%), RoboHarness 集成了 pi0.5 和 TAMP 两种底层策略

在 LIBERO-Plus 的多类扰动中,RoboHarness 会根据底层策略的实际可靠性调整调用比例:VLA 越稳定,系统越倾向于调用它;当机器人状态、语言或感知条件超出其能力边界时,则更多路由至 TAMP。RoboHarness 通过多策略协作,在 LIBERO-Plus 上取得 93.2% 的平均成功率,高于其余现有方法。
第二步:解决异构策略之间的 “交接断层”
两个策略之间常存在 “交接断层”:由于各控制策略独立设计,前一策略结束的位置,可能恰好是后一策略从未见过、无法稳定启动的状态。Memory Bridge 根据下一子任务和当前观测,从多模态记忆中检索下一目标策略的成功轨迹,提取末端位姿和关节状态,并在线拟合 “机器人状态 — 执行进程” 的空间分布,显式重建下一控制策略熟悉的状态分布。系统随后综合分布内置信度与运动代价选择目标状态,生成桥接轨迹,再将控制权交给下一策略

图 3|Memory Bridge 构造通路。
长时序任务最能暴露单一策略的能力壁垒。在约为原始 LIBERO 四倍长度的 LIBERO-LoHo 上零样本测试,π0.5 完整成功率仅 6.4%; 即使通过世界模型(H-WM)、LLM(LLM-guided)或规划语言(Logic-guided)分层拆解任务,再交由 VLA 执行,完整成功率最高也仅为 64.8%。这证明了单一模型始终很难突破现有的能力壁垒, RoboHarness 通过协同调用多种底层控制策略并保证稳定交接,将完整成功率提升至 95.2%。
表 2|LIBERO-LoHo 零样本长时序评估。RoboHarness 集成三种底层策略:pi0.5、经 RL 训练的 OpenVLA 和 TAMP。各项结果为任务进度 / 完整成功率(%)。

消融实验表明,协同并非简单地将模型串联。缺少 Understanding Skills,系统会因无法准确理解各底层策略的能力边界而出现任务分解和路由错误;移除 Memory Bridge 后,即使选对策略,也可能因交接状态不兼容而失败;缺少 Evolution Skills,系统则难以根据执行反馈修正能力判断,并在线更新各策略的能力边界。理解、适应与交接,缺一不可。

图 4|消融实验:理解、进化与 Memory Bridge 分别解决错误分解、能力估计失准和策略交接失败。
“通用具身模型” 仍是所有具身人的终极目标,但在追逐的慢慢长路中,机器人必须正视每种策略的能力边界、输入依赖与分布外脆弱性。异构策略编排提供了一条现实路径:不要求单一模型立即掌握所有能力,而是让系统理解不同策略何时可靠、如何分工和交接。
RoboHarness 逐渐积累跨策略、长时序数据,反哺未来统一具身模型训练。
它不是通用模型的对立面,而是具身智能从模型能力走向系统能力的必由之路。
文章来自于"机器之心",作者 "机器之心"。
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md