让模型自己生成训练数据、自己改写提示词、自己修复代码,这条路线被称为:
递归自我改进(Recursive Self-Improvement,RSI)。
但几乎所有RSI系统都是同一套结构:一个固定不变的改进程序,反复作用于模型。并往往只从Harness、Data或Model RSI的单一视角切入。
为了回应这一难题,CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校发布MetaRSI-v1。
这是全球首个统一Model-RSI、Data-RSI、Harness-RSI的元递归架构,能够改进“自我改进的过程”。
RSI由此进入“平方时代”。

在没有任何外部教师模型参与下,MetaRSI-v1使得一个仅30亿激活参数的小模型,在四项基准上平均自我提升10.9分;并且让GPT-5.6、Claude Opus 5等六款前沿旗舰模型,平均提升7.3分。

更重要的是数字背后, MetaRSI-v1是一套试图统一整个RSI领域的架构语言:包括一个内核、两条编排轴、三个算子、整个元RSI层,以及五大定律。

Loop Kernel是MetaRSI-v1首次提出的自我改进统一形式。
它第一次把“进步如何发生”抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在Data、Harness、Model上提出改动,交由验证器裁决,并将结果回流为下一轮信号。
Data、Harness、Model从此开始能够被统一成同一Kernel的不同实例化算子,可组合、可统一调度,自我改进由此第一次拥有了统一、可复用的底层骨架。

沿用同一个Loop Kernel,自我改进在三个空间上展开,分别由Data-RSI、Harness-RSI、Model-RSI三个算子承担并协同完成。
整套架构由四个Agent协调运作,并且均能被人类专家局部替换形成human-in-the-loop系统。
四个Agent对应形成三个RSI优化Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。
实验沿两条路线展开:
目标模型为Qwen3.5-35B-A3B(35B总参、3B激活),在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上评测。

MetaRSI-v1平均提升10.9分,SWE-bench Pro解决率接近翻倍,Meta层为RSI带来更高的天花板,连续自进化的累计增益提升显著。

多款前沿模型在Terminal-Bench 2.1上平均提升7.3分,说明MetaRSI范式对前沿模型同样成立,旗舰模型同样留有可观的自我改进空间。

MetaRSI梳理出两条互补的改进路线:Harness-RSI保持权重不变,让自我改进覆盖任何可通过接口调用的模型;Model-RSI通过训练把能力内化进模型。
且MetaRSI首次重新定义了Data-RSI,作为模型的能力边界探测与放大器,通过对执行轨迹与外界反馈learning-signal的联合分析得到经过验证的经验并scale为可复用的数据,并标定这些经验能够支撑到哪里,框定模型能力的正、负边界。
Data-RSI的产物同时供给Harness-RSI与Model-RSI消费,两条路线的改动结果又能够流回Data-RSI,重新标定能力边界、驱动下一轮,能力由此逐轮披露、累积。
在这一过程中,Harness不仅能做加法还能做减法:Data-RSI放大暴露的问题经Model-RSI内化之后,原本吸纳在Harness中的知识会变成冗余,Harness-RSI系统在回放校验下将其删除,能力留下,成本退场。
在此之上,MetaRSI提炼出五条定律。
定律一:验证决定自我改进的前沿。
一个领域能不能形成自改进闭环,取决于该领域任务能否被检验,是否有合适的verifier。
定律二:自我认知会过期,重新发现能力边界是速率瓶颈,RSI改变agent能力,其原本旧的系统描述随即失效。
定律三:能力与载体无关但成本与载体有关。
例如同一项能力放在Harness里每次推理都要重付成本,内化进Model只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。
定律四:可信度由不可写面度量。
在闭环内部,真正能力变强和放宽成功标准会得到完全相同的分数,而且这种偏差从内部无法察觉、也无法靠统计纠正。
定律五:循环不凭空创造能力,一切增益本质上都是外部信息熵的输入或能力的激发。
自改进只能重新组织、放大并固化模型已经具备的潜力。因此每次提升都要分清两部分:哪些是把已有能力放大出来的,哪些是真正从外部新引入的。
人类历史每一次的跃迁,都源于“生产答案的方式被重新发明”。
MetaRSI要在AI时代把这件事再做一遍。
它背后的CosmosMind团队,是一支由清华/北大/斯坦福等海内外名校硕博、头部大厂基模核心组研究员、著名产业方领军人物组成的小而精的团队,长期从事大规模模型训练/RSI/智能体/科学计算等工作,在顶会顶刊上发表过诸多有影响力的论文。
这一次,他们没有选择再做一个更大的模型,而是把全部精力押在了“改进改进本身”这件事上。
团队同步了开源RSI-Harness,这是一个能自我学习、自我迭代的Harness,并可以在使用中为不同科学领域与工程实践沉淀出可移植的Harness Genome。
Cosmosmind已经把目光投向了闭环触碰物理世界:可编程仪器、自动化实验室成为执行器和验证器,仿真、台架实验、真实仪器可以像三级火箭一样逐级推进,把不可逆的昂贵操作放到最后——第一个在物理世界关上的进化循环,很可能不会出现在开放环境里,而会出现在自动化实验室中。
研究者面对的不再是一堆待验证的猜测。人类只需负责定义问题与价值判断,而机器负责让“从假设到验证”的循环,以过去无法想象的速度开始转动。
相信在MetaRSI的后时代,AI将会从解题工具走向文明级的进化引擎。
Cosmomind官网:https://cosmosmind.ai/
项目主页:https://github.com/CosmosMind-ai/RSI-Harness
论文:https://www.cosmosmind.ai/research/metarsi-v1
arxiv:https://arxiv.org/abs/2609.06396
HuggingFace:https://huggingface.co/CosmosMind/RSI-Harness
文章来自于"量子位",作者 "允中"。
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0