谷歌给RSI找到了一条捷径:做梦

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

谷歌给RSI找到了一条捷径:做梦
AI资讯 2026-09-17 14:54
+9724 阅读

谷歌给RSI找到了一条捷径:做梦


AI要学会自己改进自己,谷歌打算先让它做个“梦”。


这场“梦”,瞄准的是AI行业热议的RSI,即递归自我改进:让AI改进自身,改进后的系统再继续改进自己,一轮接一轮。但这个循环有一道绕不过去的坎:换一种做事方法,究竟有没有用?如果每调整一次探索策略,都要把整轮实验重新跑一遍,AI变强的速度还不好说,算力账单倒是先涨起来了。


谷歌研究团队在新论文《Dream-RSI》中,给出了一个思路:让AI先在“梦里”试。


所谓“做梦”,就是把过去真实执行过的实验记录变成一个可以反复回放的环境,让AI在里面比较不同的探索策略:先尝试哪条路,哪些方向值得继续,什么时候该停手。有了现成的实验结果,许多策略的筛选就不用再把昂贵的实验重做一遍。


等“梦里”筛出了更好的策略,AI再带着它回到真实实验,积累新的记录,供下一轮“做梦”继续改进。真实探索为“梦”提供素材,“梦”又帮助AI调整下一次探索的方法,自我改进的循环便由此接上。


谷歌让AI在“梦里”琢磨的,正是如何让自己更会做研究。每轮实验留下的经验,都有机会成为下一轮少走弯路的本钱。


何为做“梦”RSI?


每个人都做过梦,但AI的“梦”,跟广义的梦不一样,它指的是在已经录好的历史发现树里,用新策略走一遍,看会得到什么结果。


就像在迷宫中找出口。第一次进迷宫,没有任何地图,只能瞎走。但是在走的过程中,AI会顺手把迷宫的地图画出来。


所以当第二次走这个迷宫之前,就可以先看着这张地图,大概在脑内规划一个最快的路线。


那么在脑内绘制的这个过程,就叫“梦”。


谷歌的研究团队在论文中这样描述,眼下的RSI,还没发展到“AI深夜改自己的代码、然后一夜变强”那种程度。现在行业还停留在发现循环(discovery loop)之中。


Agent提出候选方案,评估结果,吸收反馈,再提出下一轮。算法设计、数学优化、GPU内核工程,这些关键词,本质上都是同一个循环转出来的。


而循环能转多快,取决于AI如何去“探索”这个迷宫。


谷歌给RSI找到了一条捷径:做梦


要是用固定的探索策略,那它在搜索空间变大之后就不灵了,因为它不会从历史里学习并改善自己的策略。


就像每次考试都考同一道题,但是由于策略是固定的,所以就会导致AI每次都会在这道题出错。


那么让策略自己进化呗,每次跑完根据结果调整下一次的策略,不就行了?


也不行,因为这种调整策略的办法成本太高了。


因为AI公司要判断“一套新策略到底好不好”,不能只看它走了一步怎么样,得拿它完整跑一整轮再看结果。而且还会有一定概率出现这种情况,AI跑好几百次尝试、跑完所有轮次,最后发现结果还不如原来的固定策略。


因此,谷歌Dream-RSI的重点,就落在了第一次跑迷宫所绘制的地图上,即模型的探索历史。


一次在线发现跑完之后,留下的并不只是几行结论,而是一棵结构化的“发现树”。


这棵树上的每个分叉点,都是AI的某一次尝试。比如那次它写了什么代码、跑出来什么结果、得了多少分,全部在那个节点上,随时能翻出来看。


过去,AI公司把“梦”要么当成提示词塞进静态上下文,要么当成微调权重的训练数据。而Dream-RSI提出了第三种用法:把它当成一台可回放的模拟器(replay simulator)。


同一棵树,换一套探索策略去走,就会走出不一样的轨迹。并且在下一次训练的过程中,把已经走过的路从地图上划掉,专门挑不同的分支、按不同的顺序、用不同的并行度、在不同的地方停下来,就可以避免重复、浪费算力。


这棵树上的每个节点都已经被真实执行过了,所有结果都存着,所以回放一条新轨迹只需要“读”记录,不需要重跑Agent和评估器,执行成本为零。


但正如刚才提到的,之前的改进方法不一定比传统的固定策略好,很有可能出现费了半天力气调整策略,最后效果还不如以前的情况。


论文给了一个不降级保证:候选集合里始终包含当前策略,所以选出来的新策略在固定历史上的平均回放分,不会低于旧策略。


换句话说,这套自我改进,至少在设计上是“只增不减”的。


谷歌将Dream-RSI放在三个领域、八个科学发现任务上跑。包括算法工程(Lasso 正则化路径求解器)、数学优化(Sum–Difference、自相关不等式、圆堆叠)、GPU内核工程(KernelBench)。


结果是这样的。在Lasso 上,Dream-RSI优于sklearn、glmnet等标准库和强基线,相比SimpleTES最多省下162倍的Agent调用,相比固定探索基线也省约1.7倍。


在数学优化上,它在1000代以内就追平或超过强基线,相比SimpleTES省下50倍以上的预算。此前,SimpleTES在自相关问题上拿了最好的分数,代价是51200代。


在KernelBench上,它要么用1.79到2.43倍更少的代数达到目标速度,要么在同等预算下把内核性能最多提升 2.09 倍。


如果Gemini 4用的是Dream-RSI,那谷歌很可能会翻盘。


OpenAI、Anthropic的RSI又是什么


作为最头部的AI大厂,Anthropic和OpenAI又是怎么实现RSI的呢?


先看OpenAI。


9月初,它一天发了两份文档,第一份讲内部研究加速。在6月之前,Agent的总运行时长还低于人类的总工作量。到了8月中旬,Agent每天都能完成大约以前3.1个工作日的活。


OpenAI还宣布,已经实现了去年秋天承诺过的“自动化研究实习生”。这是一个能在人类指导下,完成研究工作的Agent,就连那些需要资深研究员干上几天的活,它都能自己独立完成。


OpenAI的下一步目标是,在2028年3月之前,做出“全自动化的AI研究员”,它能自己提出研究问题,然后根据提出的问题自己规划、自己跑实验。


之所以现在还叫“实习生”,是因为在4到8小时的任务里,超过一半至少需要一次人工介入。


第二份,是首席科学家雅库布·帕乔基(Jakub Pachocki)写的那篇《异种心智》(An Alien Mind)。


他把“安全”拆成两件事:目标对齐(goal alignment)和价值对齐(value alignment)。


目标对齐,指的是“AI 有没有认真去完成你交给它的任务”,比如听不听得懂指令、愿不愿意配合、能不能get你到底想干什么。


价值对齐,指的则是“当目标模糊、互相冲突,或者被丢进一个陌生、甚至有人故意使坏的环境时,它还能不能讲道理”。


诚实、有底线、对人抱有善意,只能靠一套通用规则来实现。


雅库布在文章中表示,RSI它难就难在“泛化”。


模型越聪明,越要在训练时没见过的情境里临时做判断,就越可能把学到的价值观推歪。


文章给出了一个反面教材。一个模型起初“满脑子都是对齐的念头”,可只要用足够大的优化压力逼它去达成一个很硬的目标,它就会学会“有动机地推理”。即模型在思维链上表示的都是符合规则的行为,可模型实际上做的,却是有悖于安全准则的事情,比如对某个网站发起攻击以获得目标需要的数据。


因此雅库布表示:“我们还不知道怎么安全地走到完全对齐的、完整的RSI。”


谷歌给RSI找到了一条捷径:做梦


7月中旬,OpenAI在内部网络安全评估中出事,训练中的Agent突破沙箱隔离,入侵了Hugging Face的生产系统,甚至渗透了OpenAI自己的内部网络。


事件曝光后,OpenAI暂停了部分前沿模型的强化学习训练,其中待部署模型的RL训练停了整整两周,最大规模的前沿RL训练至今没有明确具体哪天恢复。并且在恢复时,这些模型全部加装了更严格的安全监控和对齐措施。


此外,OpenAI还专门组建了RSI(递归自我改进)团队,横跨研究、工程、产品和基础设施,目标是让AI系统加速甚至主导自身的研究流程。相关工程师岗位的年薪开到38万到50万美元。


再看Anthropic。他们自己发布的文章《当AI建造自己》(When AI builds itself)就曾表示,截至2026年5月,在合并进Anthropic代码库的代码里,有超过80%是由Claude所撰写的,Anthropic管理层预计,今年会超过90%。


2026年第二季度,一名工程师每天合并的代码量,是2024年的8倍。不是因为他们每天加班,而是因为大部分代码由Claude写,人只负责指挥和审查。


Anthropic内部有个标准测试,把一段训练小模型的代码丢给Claude,让它自己优化自己的性能。但前提是改完之后训练结果不能变差,还不能破坏正确性,违反安全准则。


2025年5月,Claude Opus 4平均提速约3倍。到2026年4月,Claude Mythos Preview实现了约52倍提速。作为参照,一个熟练的人类研究员要花4到8小时,才能提高4倍。


更能说明问题的是,它开始自己提实验了。


2026年4月,Anthropic公开了一个开放式研究项目,题目是能不能用一个较弱的模型,去可靠地监督、训练一个比它更强的模型?


研究者先给这道题划了两条线,分别是弱模型自己单干能做到多好和如果直接拿正确答案去训练强模型,能有多好。


两条线中间的那段差距,就是要靠“用弱模型监督”去填的。谁填得越多,方法就越有效。


结果,两名人类研究员忙了大约一周,填上了这段差距的23%。Claude驱动的Agent,耗时800小时,花了大约1.8万美元的算力,填上了97%。


Anthropic还给人类的“研究品味”打分。


所谓研究品味,就是做研究时那些判断,比如该盯哪个问题、哪个结果值得信、哪条路其实已经走死了。


测法是这么设计的,Anthropic找出一些真实的Claude Code研究会话,专挑其中那些“走了弯路”的会话,然后把走弯路之前的记录喂给模型,让它说下一步该做什么。再另找一个能看到结果的Claude当裁判,判断到底是人还是模型选的那一步更好。


结果是,2025年11月的Opus 4.5,有51%的时候选得比人好。2026年4月的Mythos Preview,有64%比人选得更好。


国内RSI进展如何了?


视角回到国内。


8月31日,唐杰在智谱中期业绩会上的表态,下一代模型GLM-6.0定位是Fully Self-Training,完全自训练。


唐杰把这套能力的核心,称作是“自净化”,注意是净化不是进化。不把模型做得更大,相反,让模型具备自我判断能力,能够知道“什么时候停止、什么时候纠正自己”。


自净化覆盖了从模型预训练、中期训练到后训练的完整流程,最终实现自主训练和自我进化。


唐杰认为,自净化是RSI的命门。


自我改进能不能成立,其实并不取决于模型能不能生成下一步,反而取决于它能不能判断“这一步到底是不是进步”。


在这点上,唐杰的观点和谷歌Dream-RSI里的“探索策略”、Anthropic的“研究品味”,说的是同一件事,即模型如何意识到什么是好,什么是坏。


谷歌给RSI找到了一条捷径:做梦


7月11日,唐杰发表了一封内部信,标题为《巨浪已来》,宣布了一个叫“摸高”的计划。


两年战略投入,放弃短期变现,去争下一代AGI的制高点。


内部信列出的四大核心引擎里,有一个就是完全自训练。建一座高质量的合成数据工厂,用AI与AI之间的自对弈去生成知识。并在安全沙箱内,赋予系统重写自身代码的能力,让进化的速度不再被人类工程师卡住。


财报显示,智谱约有60%的资金,是用来实现RSI的。


实际上DeepSeek也有RSI,只不过并非是梁文锋亲口说的。


9月14日,DeepSeek算子工程师刘胜与发表长文《我不得不把才华埋葬在昨天》。


作者曾就读于北大2021级图灵班,担任前北大未名超算队队长、代表学校出征过国际大学生超算竞赛SC23。2025年4月加入DeepSeek,2026年参与DeepEP V2的通信算子重构。


就在发文前几天,他刚刚交付了DeepSeek V4.1的主Attention算子,这是一个直接决定推理效率的核心组件。


他在文章中提到,未来半年到一年,AI写算子的能力,大概率会追平甚至超越顶级人类工程师。


原因是这样的,DeepSeek已经能自己读懂CUDA、PTX、SASS了,还会用专业工具逐条分析“哪条指令在流水线上停了几拍”,然后动手把算子改快。


换句话说,AI已经掌握了“读代码—找瓶颈—优化—再测速”这整条性能工程循环。


刘胜与表示,他刚来DeepSeek的时候,模型还只是一个“能帮他查查文档、读读代码、找找bug的小助手”。一年之后,DeepSeek已经蜕变成“能够独立优化算子的算子大师”。


他还相信,用不了多久,AI会再往前一步。能够自己设计算子的调度方案、自己评估几套方案谁更快、再亲手把它实现和优化出来。


刘胜与表示,他算子写得越好,DeepSeek新模型的训练和推理就越快;模型迭代越快,AI自主写算子的能力成熟得就越早;而它成熟得越早,他这门手艺被替代的周期就越短。


随后刘胜与给出判断,虽然他并不会因此“失业”,但是会“转业”。从整天泡在寄存器分配与共享内存调度里的“手艺人”,转去做Agent的“机甲驾驶员”。


除此之外,DeepSeek的Harness工具,本质上也是为RSI服务的。


传统软件里,模块之间“你中有我、我中有你”,动一处常常连累十处。


DSH的特点是一切皆插件,每个功能都是独立零件,只通过一个标准接口接入,彼此不直接认识。于是任何一个插件都能单独升级、单独替换、单独进化,不必惊动其他任何人。


还有DSH的“可逆效应”和热替换这两大特点,能让改动时只动该动的那一处,装错、改炸了还能整体回滚。


文章来自于"字母AI",作者 "苗正"。

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群