Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨
AI技术研报 2026-08-30 11:55
+8910 阅读

近年来,大语言模型(LLM)智能体在长程任务中展现出强大潜力,但现有智能体框架在记忆的使用方式与迭代方式上仍面临显著挑战。


传统方法多在任务开始前根据任务检索记忆或在交互过程中通过上下文来检索经验,随着任务的推进,在任务开始阶段一次性检索的记忆已无法反映当前的问题,膨胀的上下文中又混杂着过期信息与执行噪声,检索因此越来越不可靠。检索之所以不可靠,根源并不在于缺少有用的经验,而在于缺少一个紧凑而可靠的任务状态,去把已积累的经验与当前的执行需求持续对齐。


而近期的递归式自我改进(RSI)在长程任务中也面临同样的挑战,记忆的迭代几乎只由下游任务的分数决定,无法精准定位到产生问题的具体组件,因此更新往往是粗粒度的且缺乏针对性,而面对长程任务中的推理轨迹,不断增长的上下文长度也让智能体难以在分析并在其中准确找到最有效的改进策略。


在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨

  • 论文标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
  • 代码仓库:https://github.com/Gen-Verse/Recuris
  • 论文链接:https://arxiv.org/abs/2608.24876


Recuris 与既有记忆方法的差别体现在两个维度上:记忆怎么被使用,以及记忆怎么被迭代


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


Recuris 与既有记忆方法的两个范式差别


记忆怎么用:既有框架对着不断膨胀的对话历史做记忆的注入或检索,在长程任务中容易产生幻觉,导致技能调用错位;Recuris 在执行事件上取用技能,并由检查器把环境返回转成经过验证的状态更新,而不是听信对话里的一句「已完成」。记忆怎么迭代:既有框架从单次任务成败出发重写整个记忆;Recuris 读取结构化轨迹,把失败定位到具体组件、只修改引起问题的组件,并且只有通过验证集的门控后才被接受。


性能表现:


从 3B 小模型到 Claude Opus 5 全面暴涨


研究团队在四个长程基准(τ²-Retail、τ²-Airline、SkillFlow、Terminal-Bench 2.1)与十个模型上进行了评测。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


Recuris 在从 3B 开源模型到前沿模型上的表现


从 3B 的小模型到 Claude Opus 5 和 GPT-5.6-Sol 这样的前沿模型上,Recuris 均展现出了大幅的性能提升。同时在长程任务上,这一优势不随交互轮次的增加而衰减,并大幅降低了长程执行中常见失败模式的发生率。


长程可靠性:


优势不随任务变长而衰减


长程能力的常见评价困难在于,「任务变长」和「智能体提前放弃」会互相混淆。因此研究团队按任务本身需要多少轮才能完成把 τ²-Retail 分成四个分位。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


按任务固有长度分位的长程表现


Recuris 在全部四个分位上都领先基线,幅度 +17.0 至 +44.7,不随任务变长而单调下滑


结构化轨迹让失败可以被定位


递归改进的前提是知道该修哪里。研究团队没有停留在观察记忆,而是主动向记忆中注入已知故障,再让一个固定的裁判从三种证据中判断是哪个组件出了问题:只看最终成败、看原始轨迹、或看 Recuris 产出的结构化轨迹 Γ。故障池按类别均衡构造,因此一个「永远答同一个组件」的裁判会得到 33.3%。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


只看成败的定位准确率 13.0%,低于常答同一答案的基线;看原始轨迹 37.0%,仅比基线高不到四个点;而看结构化轨迹达到 64.8%,接近基线的两倍


演化出的记忆能迁移:


跨任务,也跨模型


跨任务:记忆从 16 个失败任务中蒸馏而来,在从未参与过的 86 个任务上仍带来 +9.01 至 +17.44 的提升。这一结果验证了 Recuris 的核心假设:结构化的失败轨迹中蕴含的信息足以支撑跨任务迁移。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


演化出的记忆在留出任务上的表现


跨模型:一份记忆只在部署模型上演化一次,随后原封不动交给从未参与演化的前沿模型,同样也能产生明显提升,进一步证明了框架的泛化性。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


关键技术解析


论文给出的判断是:长程场景下真正的瓶颈并非「没有可用的经验」,而是缺少一个紧凑而可靠的任务状态,用来把已积累的经验与当前的执行需求持续对齐。Recuris 的三项核心技术都围绕这一判断展开。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


Recuris 架构总览


经验记忆 — 工作记忆耦合(EM–WM Coupling)


工作记忆(WM)正是那个缺失的状态表示。它持续追踪智能体的当前进展与未解决的目标,并据此从经验记忆(EM)中选取最合适的技能;技能执行后,环境反馈验证进展并更新状态,闭合成一个循环:


任务状态 → 技能选择 → 执行反馈 → 更新的任务状态


具体而言,技能调用发生在执行事件上:草拟一次状态改变调用,或到达一个交互轮次的边界,而不是对着膨胀的历史上下文做相似度匹配。智能体动作之后,检查器依据环境返回的工具回执验证进展,只有被证据支持的状态变更才会被提交:调用了技能、或尝试了一次工具调用,都不算真正完成


结构化轨迹与组件级失败定位


既有方法大多只能从最终成败中学习,这类信号说明「出了问题」,却无法指出该修的是存储的技能、追踪的任务状态、技能调用机制,还是进度验证器。EM–WM 耦合把任务状态、被调用的技能、动作与观测显式串联起来,把执行过程本身变成了关于「记忆如何影响行为」的证据


EM–WM 耦合 → 结构化证据 → 失败定位 → 靶向记忆演化


它把「这次任务失败了」变成「是哪一个组件让它失败」,从而使局部修补成为可能,而不必整体重写记忆。


有界的、验证门控的递归演化


一个固定的 Meta-Agent 读取结构化轨迹,把每个诊断出的失败归因到某个记忆组件,并只修改被引发问题的组件;一个固定的门控只在补丁修复了目标任务、且不在留出集上造成回退时才准入。被接受的更新改变未来的执行模式,产生新的优化信息,进而支撑下一轮更新。


Agent记忆新范式Recuris:3B小模型到Claude Opus 5全线暴涨


递归演化的动态


主要作者介绍


余昭辰:新加坡国立大学博士生,研究方向为大语言模型推理、智能体系统与自我改进。


杨灵:普林斯顿大学博后研究员,研究方向为大语言模型和强化学习。


王梦迪:现任普林斯顿大学电子与计算机工程系终身教授,并创立并担任普林斯顿大学「AI for Accelerated Invention」中心的首任主任。她的研究领域涵盖强化学习、可控大模型、优化学习理论以及 AI for Science 等多个方向。


颜水成:新加坡国立大学教授,IEEE / ACM / AAAI / IAPR Fellow,研究方向涵盖计算机视觉、机器学习与多模态大模型。


本工作合作者包括斯坦福大学博后吴英成,牛津大学博后尹榛菲等



文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群