深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架
AI资讯 2026-08-09 11:58
+9001 阅读

深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架


01 引言


2026年,递归自我改进(RSI)在软件世界已经跑通了闭环。Karpathy的AutoResearch是个极好的缩影:AI自己改代码、跑实验、留下有效的改动,循环往复,性能自动攀升。逻辑很漂亮,但有一个藏得很深的前提——环境是已知的。代码沙盒不会变,编译器规则不会漂移,评估指标在实验开始前就已经写死。智能体要做的,只是在这个封闭世界里找更优解。


物理现实没有这个前提。


机器狗不会提前收到一份涵盖所有障碍物的规则文件。工厂数字孪生会随零件磨损悄悄失真。自主实验室随时可能冒出当前假设根本解释不了的数据。现实太大、太动态、太充满意外——无法枚举,无法冻结,出错后也没有低成本的"重跑"按钮。当整个行业都在卷模型的初始泛化能力,试图靠训练阶段的蛮力让系统部署后硬撑时,一个根本性的问题被长期悬置了:AI进入物理世界之后,如何持续自我进化?


MirroS给出了第一个完整回答。他们首创性地提出了Physical RSI——在公开文献中,第一次有人将递归自我改进的逻辑从数字环境系统性地延伸到物理现实,并交付了从概念定义、运行机制到研究路线图的完整框架。(原文见MirroS官方博客:Building Physical RSI Beyond the Known World,公众号「MirroS」亦有中文摘要。)


02 Physical RSI是什么


MirroS的核心贡献,不是做了一个更好的机器人,也不是训了一个更大的世界模型,而是首创性地定义了Physical RSI这一新范式


理解这个范式,需要先看清它与数字RSI之间的结构性差异。


数字世界的RSI本质上是单轴进化:环境和评价机制已知且固定,智能体只需要不断改进自身的策略(Actor)。AutoResearch是典型——代码沙盒不会变,变的只是智能体写出的训练代码。


但在物理世界,环境本身就是智能系统需要持续学习和建模的对象,同时,它又是未知的、流动的。机器狗不知道下一步会踩到什么,工厂控制器不知道机床今天的状态跟昨天有什么微妙差异。如果世界模型对环境的物理特性、关键状态或因果关系理解有误,那么无论动作策略优化得多么精妙,都建立在一个错误的前提之上。


因此,Physical RSI必须是双轴耦合的——Actor和World Model必须同步迭代,两者由此形成持续的双向反馈。


深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架


系统必须先理解世界,才能优化动作;而每一次动作的结果,又会暴露世界模型的盲区,驱动认知的更新。两者中每一方的进步,都会为另一方揭示出下一阶段需要突破的前沿。


这个洞察听起来直觉上很自然,但在它被清晰表述之前,行业里几乎没有人把"改进世界模型"和"改进行动策略"作为一个统一的递归过程来设计。大家要么在做更好的策略学习,要么在做更逼真的仿真环境,但两条线基本是割裂的。MirroS把它们焊接为同一个递归框架。


更重要的是,MirroS没有把自己局限在某一个垂直应用里。Physical RSI面向的是所有需要在物理世界中与未知交互的智能系统——具身智能、先进制造、科学发现。它的技术野心,不是解决某一个场景的问题,而是为物理世界中的智能系统提供一套World Model与Agent协同进化的底层框架。


03 将意外变成进化的燃料


宏大的范式需要精确的机制来支撑。MirroS设计了一套以“意外”(OOD事件)为驱动的八步演化循环,拆解开来,有三层设计值得细读。


深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架


第一层:出了事,先问“是不是我理解错了这个世界?”


想象在陌生城市驾车,导航指示左转,但前方道路已被封闭。此时问题不在于驾驶技术,而在于地图过期了。不更新地图,换再多路线也无法通行。


Physical RSI面对的正是同一类问题。 MirroS的诊断逻辑与此一致。当系统遭遇意外——比如机器狗被电缆绊住——第一反应不是盲目尝试新动作,而是自检世界模型能否复现刚才的失败因果:电缆路径、接触关系、张力传导、腿部运动是如何共同导致了缠绕?


如果世界模型无法复现这个过程,说明认知存在盲区,第一优先级是补全世界模型——这是Environment Gap。只有当失败可以在模拟中被稳定复现时,才轮到搜索新的恢复策略——这是Skill Gap


这套“先问认知,再问动作”的诊断逻辑,背后是一个更本质的判断:世界模型是对真实世界的映射,而任何映射从第一天起就不可能完美——它必须在与现实的反复碰撞中被校验、修正、扩展。世界模型本身就需要自己的递归改进循环。否则一个带着错误环境假设的系统,动作策略优化得再精妙,也是在朝错误的方向精确前进。Actor 需要 RSI,World Model 同样需要 RSI,两者叠合在一起,才是完整的 Physical RSI。


第二层:地图要能改——为什么世界模型必须用代码构建?


诊断出“地图错了”,下一步是修正地图。这就要求世界模型的错误是可定位、可修正的


当前主流的世界模型方案——视频生成、3D神经场、端到端的隐空间表征——共享一个致命短板:出错时,难以判断黑盒内部究竟哪里出了问题。就像一张位图模糊了,只能看到"这片糊了",却无法定位并修改。


MirroS选择了一条更根本的路径:构建一个agentic的世界模型——它并非像素级复制,而是将多模态经验翻译为语言层面的抽象,并借助代码等工具将这些抽象转化为显式的、可执行的结构。语言让模型调用预训练的科学与常识知识,代码则将知识具象化为可调试的因果规则——哪条预测有误,就定位、修改、重新验证,如同矢量地图修改局部不影响全局。


这一选择并非偶然技术偏好,而是递归改进的必要条件:若模型无法精确修正,则改进无从谈起——改了什么?对错如何判断?均失去依据。同时,这种基于抽象与可执行规则的模型天然具备跨场景迁移能力,一套验证过的柔性线缆接触力学,可从仓库无缝迁移到手术室。


第三层:不能坐等意外——主动探索未知


如果系统只是被动等待意外发生,进化速度就只能取决于运气。


在MirroS的路线图中,前三个研究方向——环境理解与抽象、智能体物理推理、基于经验的持续学习——解决的是"意外发生后如何应对"。而第四个方向——主动发现未知——才是整个系统从"被动应急"迈向"自驱进化"的关键闭环。


系统需要感知自身知识的边界,主动设计实验去探测盲区。回到驾车的类比:这让系统从一个遇到封路才更新地图的驾驶员,转变为一个主动前往未标注路段进行测绘的勘探者


完整的演化循环由此闭合:遭遇→意外→诊断→抽象→模拟→求解→验证→内化每一次走完这个循环,系统积累的不仅是某个具体问题的解法,更是完整的全链路经验——识别何处失败、修正世界认知、搜索应对策略、在现实中验证。这些经验规模化积累、抽象并复用后,便构成了推动Actor和World Model持续加速改进的递归基础——系统解决第一百次意外的速度,将远快于第一次。


深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架


04 经验的复利,与更难的那条路


深度|数字世界AI已经会自我改进了,物理世界呢?MirroS首发Physical RSI框架


递归自我改进已经不是概念。田渊栋离开 Meta 创办 Recursive Superintelligence,Ilya Sutskever 的 SSI 获得 NVIDIA 长期战略合作,Jeff Dean 上周携 Sanjay Ghemawat、Quoc Le 离开 Google 组建 Discovery Loop 以自动化科学实验闭环,ICLR 2026 专设了 RSI Workshop。从学术界到工业界,判断已经收敛:让AI递归地改进自身,是通向下一代智能的核心路径。


但当前这些努力几乎都落在数字一侧——改写代码、迭代模型、加速实验。成果显著,路径清晰。然而纯语言智能的边际收益正在递减,这一点也正在成为共识:物理世界的理解与交互才是AI下一个数量级的增长轴。而要在物理世界中实现真正的多模态智能,仅靠训练阶段的蛮力不够,系统必须具备部署后持续进化的能力。这正是RSI的逻辑必须延伸至物理现实的根本原因。


代码侧的RSI已经在路上,MirroS要做的不是推翻它,而是让这个范式把语言中涌现的智能,搬进能感知、能推理、能行动的物理世界里。


这是一条更难的路,MirroS选择从这里开始。


文章来自于微信公众号 “Z Potentials”,作者 “Z Potentials”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群