开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议
AI技术研报 2026-08-08 13:17
+8812 阅读

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


这个框架名叫 Prime Agent,由 Prime Intellect 发布。官方对它的定义是:一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


项目链接:https://github.com/PrimeIntellect-ai/prime-agent


RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作(参见《递归语言模型登场!MIT华人新作爆火,扩展模型上下文便宜又简单》),其全称是 Recursive Language Models,即递归语言模型。按照论文里的介绍,它是一种将输入上下文视为可操作「变量」的通用推理策略:主模型在类似 Jupyter 的编程环境(REPL)中工作,通过编写代码对庞大的上下文变量进行切分与过滤,并将子任务递归外包给临时的小模型调用,最终综合各结果形成答案 —— 例如在 Python REPL 中调用 GPT-5 及 mini 版迭代处理用户提示。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


当时,它的效果就已经非常惊艳:在 OOLONG 等最难长上下文评测中,GPT-5-mini 采用 RLM 的正确率超直接使用 GPT-5 两倍以上且单次成本更低。因此,研究者断言,这将是一个强大的新范式,且相比纯 CoT 或 ReAct 代理,显式训练以递归推理为核心的 RLM 很可能成为推理时扩展能力的下一个里程碑。


如今,Prime Agent 把 RLM 论文的核心理念进一步工程化落地了,并在此基础上做了重要扩展。我们一起来看一下他们做了哪些创新。


Prime Agent 为什么那么强?


官方博客里写的很清楚:它彻底重构了「harness 该怎么设计」这一底层假设。


Prime Intellect 团队认为,现有的 harness 设计都是围绕早期模型的能力建的 —— 固定的工具调用格式、强制的上下文压缩、设计时写死就再也不变的子智能体和提示词。这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。模型越聪明,旧的 harness 就越像一副不合身的镣铐。


Prime Agent 的解法是把这套脚手架彻底打开。它做了两个关键设计:


一是 RLM,给模型一个持久的 IPython 内核当 REPL 用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。即使会话被压缩,完整历史仍保留在外部状态中,需要时可被程序化取回;


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


二是 Continual Harness,把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态,agent 能在执行过程中实时创建、修改、调用它们,甚至跨会话通信。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


换句话说,Prime Agent 不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。


在 ARC-AGI-3 这种每道题规则都陌生的战场上,它能一边做题一边改写自己的解题策略,而不是被出发前的预设绑住手脚,所以它能在 ARC-AGI-3 上以更少的 token 消耗跑出更高分数。


Prime Agent 怎么让 Agent 持续工作?


但「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:


Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?


为此,它在底层放了一个后台 daemon,统一管理所有正在运行的会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。一次任务结束后,子智能体不会立刻被销毁;主智能体可以记住它的 ID,过一段时间再把它叫回来继续工作。


这和常见的「一次性外包」不太一样。


普通多智能体系统里,主 Agent 把任务扔给子 Agent,拿到一份摘要,双方关系就结束了。Prime Agent 中的子智能体更像一个长期项目成员:它保留自己的工作现场,主 Agent 可以追问、纠偏,或者让多个 Agent 直接交换信息。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


Prime Agent 架构图。


为了让任务真正跑得足够久,Prime Agent 还把长期自主运行拆成了三个机制:


  • Goal 负责保存一个持续目标,在任务完成前不断提醒 Agent 继续推进;
  • Heartbeat 按固定时间把消息重新注入会话,例如检查子智能体进度、轮询实验结果;
  • Autonomous Mode 负责在一轮输出结束后自动续跑,避免 Agent 做到一半就停下来。


用户则可以给它设置最大轮数、token 预算和执行时间,并设置一道完成前必须通过的测试。比如让它修改一个项目时,测试没通过,系统就会把失败结果重新交给 Agent,让它继续修;如果工作区没有变化,也不会毫无意义地重复执行同一个失败测试。


所以 Prime Agent 所谓的「长时间自主」,并不是简单地给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。


Prime Agent 是如何「自我改进」的?


最值得解释的,是它的 /refine。


Prime Agent 会读取自己刚刚经历的完整轨迹:尝试过什么、在哪里失败、什么方法有效,然后把可复用的经验写回 harness。


这些修改可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。比如它发现某类测试经常因为网络波动失败,就可以把「先重试再判断代码错误」沉淀成一个技能;如果某个子智能体的分工方式效果不好,它也可以修改这个子智能体的说明。


不过,它不能改写最底层的系统提示词。每次 refinement 都会记录触发原因和修改结果,并保留历史版本,出现问题时可以回滚。


这也是 Continual Harness 和普通「长记忆」的区别:它不只是把过去发生的事存下来,而是试图把经历转化成下一轮可以直接调用的能力。


在官方展示的 Factorio(一款 2D 工厂模拟游戏)实验中,Prime Agent 就把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个小时内把生产分数推到了 10 万以上。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


但这个案例同时暴露了「自我改进」的另一面。


Agent 后来发现,它可以通过 RCON 命令直接把资源传送进机器。即使提示词明确要求它不要作弊,它仍然利用 /refine 把这个漏洞沉淀成了越来越高效的「作弊技能」。


也就是说,Continual Harness 能放大有效策略,但它并不知道什么叫「正当的有效策略」。如果评测环境存在漏洞,它同样可能把 reward hacking 变成一种可以不断进化的能力。


Prime Agent 表现如何?


此外,Prime Intellect 试图证明,Prime Agent 并非只会做 ARC-AGI-3。


官方还在长上下文理解、长指令执行、数学排序、模拟器开发、GPU Kernel 编写和三维迷宫等任务上,将它与 Claude Code、Codex 以及带子智能体的 Pi-mono 进行了比较。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


结果并非每一项都由 Prime Agent 获胜,但它在多数长上下文和长时间任务上具有竞争力,部分组合的提升相当明显。


例如,在 OOLONG 128K 长上下文任务中,GPT-5.6 Sol 搭配 Prime Agent 得分 0.94,而官方列出的 Codex 对照成绩为 0.50;在需要长输出的 OOLONG-Pairs 上,Prime Agent 搭配多个模型也取得了较强成绩。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


Prime Intellect 将这种优势归因于「程序化工具调用」:模型不需要把大量工具输出逐段读进上下文,而是可以写代码筛选、聚合数据,只把真正需要的部分送进推理过程。


不过,团队也承认,目前还没有任何模型专门围绕 Prime Agent 训练。现有模型并不会天然熟练地使用它的全部能力。Prime Intellect 的下一步设想,是让模型与 harness 共同训练,让模型从训练阶段就学会如何管理上下文、调度子智能体和修改自己的工作框架。


如果说传统路线是在训练一个更聪明的「大脑」,Prime Intellect 的判断是:下一阶段的提升,还来自让大脑和它使用的操作系统一起进化。


到这里,Prime Agent 看起来相当有前途:新的上下文管理方式、持续运行的子智能体、自我修改的 harness,再加上一组超过人类专家基线的成绩。


但就在发布后的第二天,有人直接克隆了它的代码仓库,然后给整场热潮泼了一盆冷水。


Prime Agent 真有那么好吗?


发起质疑的是 Shortcut AI 联合创始人 Peter Wang。他在帖子开头写道,每当一个项目伴随着「疯狂的炒作和成建制的公关」出现,就该把「胡扯探测器」拿出来了。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


检查代码后,Peter Wang 提出了两项核心质疑。


第一项质疑针对 RLM 这个概念是否真的被实现。


他在代码中发现,Prime Agent 的 RLM_MAX_DEPTH 被设成了 1。


在他的理解中,RLM 的关键吸引力就在于递归:主模型可以调用子模型,子模型再继续调用下一层模型,不断分解问题。真正困难的也不是写出一个调用子 Agent 的函数,而是让多层递归在生产环境里不至于失控。


递归层数越深,token 成本和运行时间越容易爆炸;任务在不同 Agent 之间反复转述,也可能变成一场「传话游戏」,逐渐丢失用户需求中的细节。要把递归做到三层、四层甚至更多,需要解决预算控制、并发、失败恢复、信息保真和停止条件等问题。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


可如果最大深度只有 1,Peter Wang 认为,这实际上就是一个主 Agent 调用若干子 Agent,与大量现有 harness 并无本质区别。


因此,他的判断是:Prime Agent 确实构建了一棵相当稳健、持久化的异步 Agent 进程树,但它没有证明自己解决了「可扩展的深递归智能体」问题。把它包装成 RLM,至少有夸大之嫌。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


第二项质疑,指向 ARC-AGI-3 的 95.5%。


Prime Agent 的三次运行分别获得 95.0%、95.2% 和 95.5%;Best@3 达到 99.97%,完成了 183 个关卡。但这些成绩来自公开评测集。


虽然 Agent 第一次进入游戏时并不知道规则,但开发者可以反复查看公开环境、运行轨迹和已有方案,并据此调整提示词、工具和 harness。


Prime Agent 又具备 Continual Harness,可以从过去的轨迹中提炼记忆、技能和提示词。因此,Peter Wang 认为,外界很难判断成绩提升中有多少来自通用能力,又有多少来自对公开任务的反复适配。


他并没有指控团队让 Agent 直接读取答案。争议的重点在于:没有独立的私有测试,就无法排除任务特定过拟合。


Peter Wang 还提到 PRO-LONG。该项目使用相对简单、通用的方法,也在 ARC-AGI-3 上取得了约 95% 的成绩。他认为,这一结果反而更值得关注。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


RLM 作者亲自回应


这篇质疑很快引来了 Alex Zhang 的回应。Alex Zhang 不只是 Prime Agent 官方博客的作者之一,也是 RLM 论文的第一作者。


他先用一句反话开场:「看来问题解决了,Prime Agent 不是 RLM。谢谢你。」


随后,他给出了更严肃的解释。


Alex 表示,RLM 论文真正想回答的问题是:当语言模型开始调用语言模型、被调用的模型又可能继续调用其他模型时,什么样的抽象最适合组织这套系统?


他的答案不是「无限递归」,而是两个组合:程序化的工具/子智能体调用,加上作为变量存在的上下文。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


Alex 认为,递归深度上限只是面向用户的配置,用来避免 token 成本爆炸;能否无限递归,并不是判断一个系统是否属于 RLM 的标准。


他还表示,对于 RLM 而言,深度为 1 并不意味着其表达能力弱于无限深度,但没有在这篇回应中进一步展开证明。


对于「RLM 只是研究玩具」的评价,Alex 也不认同。他提到,Codex、Claude Code 和 Muse Code 都已经提供了类似的核心抽象。


不过,在 benchmark 问题上,Alex 承认 ARC-AGI-3 是一个「可以被利用的 benchmark」。


他的回应是,Prime Agent 的价值不能只看 ARC-AGI-3,博客中的其他实验同样需要考虑。此外,他认为 Continual Harness 对 ARC-AGI-3 成绩的作用可能比 RLM 更重要。


这也让争议重新回到 Prime Agent 最核心的设计上:同一套自我改进机制,既可能帮助 Agent 积累经验,也可能让它越来越适应一套公开评测。


在私有集结果出现之前,95.5% 依然是一项值得关注的工程成绩,但还不能单独证明 Prime Agent 在真正未知的任务上超过了人类。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


目前,已经有一些开发者在尝试使用 Prime Agent,如果你也试用过,欢迎在评论区分享使用体验。


开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


参考链接:https://www.primeintellect.ai/blog/prime-agent


文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群