让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME
AI技术研报 2026-07-24 10:45
+5456 阅读

作者介绍:李旭浚、郑克寒等来自清华大学计算机科学与技术系,研究方向包括 LLM Agent、大语言模型强化学习和测试时学习。


当大模型 Agent 被部署到工具调用、长程任务和开放环境中,一个关键问题会随之出现:能否在不更新模型参数的情况下,将执行经验沉淀下来,并在下一次做得更好?


「技能演化」(skill evolving)正是这样的测试时学习范式。Agent 执行任务后,系统从轨迹中总结可复用技能,比如工具调用流程、API 前置条件或领域操作经验;之后再遇到相似任务,这些技能会被检索出来,作为上下文提供给 Agent。但现有流程本身通常是静态的:抽取、重构、修订和过滤技能的策略往往由人工预先写死。既然技能可以从执行经验中演化出来,那么「产生技能的算法」是否也可以在测试时继续演化?


清华大学与华为基础模型部的研究者在论文中给出了答案:HiSME,一个轻量级的层次化技能元演化框架。它不更新底层 LLM 参数,而是在文本空间中同时优化两类对象:面向任务执行的技能,以及面向技能生成与维护流程的 「元技能」(meta-skills)


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


  • 论文标题:You Live More Than Once: Towards Hierarchical Skill Meta-Evolving
  • 论文链接:https://arxiv.org/abs/2605.28390


静态技能演化的缺口


静态技能演化有两个痛点。第一,它很难适配不同场景:例如,工具调用强调 API 参数和状态追踪,而开放世界 embodied task 更依赖长程动作组合与失败恢复,单一固定策略难以兼顾。第二,它的维护成本没有保证。如果演化算法存在系统性偏差,系统就会反复生成低质量技能,再投入额外成本进行修复、回滚或过滤。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

图1:静态技能演化算法的两类问题


HiSME 的核心观点是:技能演化可以被看作对 Agent 测试时边际性能收益的优化。在不改变模型参数的前提下,技能库为固定执行器提供额外经验;而如果技能演化算法本身不是最优的,它与理想演化算法之间仍存在更高阶的边际收益,可以继续从测试时经验中挖掘。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

图2:从技能演化到元技能演化:边际效用的进一步挖掘


HiSME:对「经验沉淀机制」再做一层经验沉淀


HiSME 把整个系统分成三个层次:轨迹、技能和元技能。


第一层是 Agent 执行任务产生的轨迹。系统根据成功率、正确性、计算开销等效用指标评价轨迹,并从中抽取可复用技能。无论一次轨迹成功还是失败,只要系统能够评价它,就可能沉淀出「以后应该怎么做」或「以后不应该怎么做」的经验。


第二层是技能演化。HiSME 设计了一套完整的演化框架,使用 extractor 从单条轨迹中发现候选技能,使用 refactorer 从多条相似轨迹或已有技能中抽象共享结构。为避免技能库被噪声污染,它还通过 bundle tester、credit assigner、refiner 和 filter 检查技能契约、分配后验信用,并据此修订、禁用或保留技能。


同样,只要系统能够评价 skill,就可能沉淀出「以后该怎么提炼或修改 skill」的经验。HiSME 对 skill 的评价主要关注两个维度。第一个是有效性:某个 skill 被提供给 Agent 后,后续轨迹的效用是否真的提高。第二个是复用性:这个 skill 是否会在后续任务中被频繁检索或调用。有效但不可复用的经验,同样需要不断完善;经常被检索但带来负反馈的技能,则需要收窄触发条件、重写接口,甚至直接丢弃。


第三层就是元技能演化。HiSME 不只记录「某个 skill 好不好」,还会记录它由哪个算法角色产生或修改:是 extractor 从单条轨迹中抽取的,还是 refactorer 从多条轨迹中归纳的,或是 refiner 在维护阶段修缮的。当 skill 后续积累了有效性和复用性反馈,系统就能反过来评价对应的演化策略,通过专门的 meta refiner 部件进行总结,沉淀成 meta skill。


这类 meta skill 更像面向算法角色的方法论,即 rules-of-thumb prompts。例如,extractor 可能学到:不要仅凭表层情绪词抽取 workflow,除非它对应可验证状态、API 前置条件或跨轮依赖;refiner 可能学到:技能误触发时,应优先收窄 trigger condition。这些元技能会被写回 skill extractor、refactorer 和 refiner 的 prompt 中,让后续技能演化算法根据测试时反馈调整策略。


这也是 HiSME 的轻量之处:把元经验以简单的文本规则维护起来,并作为上下文指导后续演化。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME

图3:HiSME 的层次化技能元演化流程


实验:性能提升,也学到了可迁移的演化策略


论文在 BFCL-v3 multi-turn base 和 MineDojo 上进行了验证。前者关注多轮工具调用,后者关注 Minecraft 开放世界中的长程 embodied interaction。除无技能基线和静态演化基线 SkillX 外,实验还加入了 AWM、Memento 两个 test-time learning 基线,以比较不同测试时学习范式之间的取舍。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


从主要结果看,HiSME 在两个榜单上都表现出稳定优势。相比无技能基线、静态技能演化方法,以及 AWM、Memento 等 test-time learning 基线,HiSME 的收益来自更善于生成、修订和筛选技能的演化流程。尤其在 MineDojo 这类长程交互任务上,HiSME 还体现出明显的 token 开销优势:高质量 skill 减少了无效探索、失败恢复和重复重试,让 Agent 更快找到可执行路径。


消融实验显示,refactorer 是关键组件之一。可复用结构往往不是单条轨迹中孤立出现的灵感,而需要跨轨迹证据来支撑;extractor、refiner 和 credit filter 也共同构成了技能生成与维护的闭环。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


论文还对算法的演化过程进行了具体的统计分析。研究者在训练中定期保存中间技能库,并在测试集上重新评估。可以看出,随着训练任务增加,HiSME 与 HiSME-static 都能逐步改善技能库,但 HiSME 在大多数中间阶段保持了更高的测试表现,说明元演化能够在技能生成、修订和过滤的过程中持续改善策略。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


credit 分析进一步解释了这种优势:随着训练推进,HiSME 产生的 helpful skill 占比提升,harmful skill 占比得到控制;元演化能把后续反馈写回技能抽取和维护流程,减少重复产生错误技能模式的情况。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


为了验证算法不仅能产出高质量技能,还能沉淀出良好的元技能库,论文进行了 meta-test:把一次 HiSME 运行中学到的元技能冻结下来,作为新一轮静态技能演化的初始化规则。结果显示,static from meta 显著优于 static from scratch,并接近完整 HiSME,说明元技能本身也具有较高质量和一定的迁移性。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


从 Skill 到 Harness:下一步是自动驾驭工程


HiSME 的意义不只在于 benchmark 分数。它更像是在提出一种 Agent 系统优化范式:测试时学习不必只发生在模型参数中,也不必只停留在经验库中;围绕模型运行的外部 harness,包括提示词、工具路由、记忆、评测器、技能库维护策略,都可能成为可演化对象。


由此可以引出两个方向。其一是 Learning to Evolve:把文本化元技能与轻量参数学习结合,让系统同时学习经验内容和演化能力。其二是 Automatic Harness Engineering:针对不同模型和任务,自动调整外部驾驭系统,让 Agent 在部署后形成更适合自己的工作方式。


让Agent学会「如何演化」:清华、华为提出层次化技能元演化框架HiSME


对于越来越复杂的 Agent 系统来说,真正困难的也许不只是「让模型做对一次任务」,而是让它在真实反馈中判断:哪些经验值得保留,哪些规则应该收窄,哪些失败模式说明演化算法本身需要改变?


HiSME 的回答是:让 Agent 活不止一次,也让它的学习方式本身有机会被学习。


文章来自于"机器之心",作者 "李旭浚、郑克寒"。

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群