ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了
AI资讯 2026-10-11 22:34
+9670 阅读

前两天,OpenAI 在 GitHub 上一次性放出了 722 篇数学手稿(后面撤回了几篇),覆盖数论、几何、理论计算机科学、数学物理等 17 个领域,其中一部分附带了可由计算机机械检查的 Lean 形式化证明。据 OpenAI 介绍,它们全部出自一个尚未发布的内部前沿模型,平均每个结果消耗的算力大约相当于 ChatGPT Pro 思考模式运行三个小时。


这并不是 OpenAI 在数学上的第一次大动作。一个月前的 9 月 8 日,它就宣布内部模型调度上万个智能体、历时约 88 小时,给出了与 Navier-Stokes 千禧年难题相关的爆破证明,随即陷入署名与优先权之争。722 篇手稿发布后,质疑同样接踵而至。


争议之外,有一个事实很少被提及:数学之所以能成为 AI 攻城略地最快的科学领域,很大程度上是因为它自带裁判,即一份 Lean证明对不对,编译器说了算。


可一旦问题从纸面转向物质世界,比如某种新材料能否在液氮温区实现超导、某种合金在高温下会不会开裂,就没有任何形式化系统能替代一次真实的实验。


这正是 Liam Fedus 在最新一期播客 The Frontier 中强调的观点。这位 ChatGPT 的共同创造者、OpenAI 前副总裁、后训练负责人,如今在门洛帕克搭建实体实验室,试图为 AI 科学家补上互联网给不了的那块数据。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


在与主持人、Mercor 创始人 Brendan Foody 长达 50 分钟的对谈中,他回顾了 ChatGPT 诞生前后的内部细节,解释了 ChatGPT 和 AI 编程为何率先突破,也讲清了 Periodic Labs 为什么非建实验室不可。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


https://x.com/BrendanFoody/status/2108663727197462818


从缅因乡下到 ChatGPT:一位物理学家的绕路


Fedus 在缅因州的乡村长大。他回忆,学校有一项名为「新闻里的科学」的作业,要求学生撰写本地的科学新闻,可乡下报纸上实在没有多少技术进展可写,他只好上网找素材,结果被一个物理网站深深吸引。上大学时,他曾在物理、化学和经济学之间摇摆,最终选定了物理,因为它「足够基础」。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


在 MIT 读物理期间,他参与了一个名为 DMTPC 的暗物质探测项目。按照其中一种理论,暗物质信号会随时间呈现方向上的变化,团队希望据此造出灵敏度更高的探测器。


也正是在这里,他第一次撞上了机器学习问题:要从探测器的原始数据中反推粒子的方向和能量,本质上就是一个机器学习任务。此后他短暂进入金融业,又在加州大学圣地亚哥分校攻读粒子物理,参与 CERN 的粒子径迹重建,同样的问题再次出现。「我意识到,要推动机器学习的前沿,就必须待在那些前沿机构里。」


转折发生在生成对抗网络(GAN)大热的年代。Fedus 尝试把 GAN 用于语言生成,却发现这是双重难题:GAN 本身训练不稳定、容易模式崩溃,而生成器输出的是离散 token,判别器的梯度无法直接回传,于是「你同时拥有了 GAN 的所有问题和强化学习的所有问题」。


他为此给时任 Google 研究员的 Ian Goodfellow 写了一封邮件,对方的回信让他下定决心加入这批人。


2016 年,他以实习生身份加入 Google Accelerated Sciences 团队,用卷积网络研究酵母细胞的复制与分裂,之后进入 Google Brain,并在 Mila 跟随 Yoshua Bengio 与 Hugo Larochelle 完成计算机科学博士学位。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


在 Google Brain,Fedus 与 Barret Zoph、Noam Shazeer 合作提出了 Switch Transformer,将混合专家(MoE)架构推到了万亿参数规模,这一工作后来成为开源 MoE 模型的重要参照。


2022 年他加入 OpenAI,参与创造了 ChatGPT,2024 年 10 月接替 Barret Zoph 执掌后训练团队,2025 年 3 月离职创业。


他创立的 Periodic Labs,另一位联合创始人是 Ekin Dogus Cubuk。两人在 Google Brain 相识近十年,Cubuk 后来在 DeepMind 领导化学与材料团队,是 GNoME 论文的作者之一,该项目在 2023 年预测出了大量新的稳定晶体结构。2025 年,Periodic Labs 以 3 亿美元种子轮走出隐身状态,投资方包括 a16z、DST、英伟达旗下 NVentures、Accel,以及 Jeff Bezos、Eric Schmidt、Jeff Dean 等个人投资者。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


今年 9 月中旬,Periodic 发布了首个模型 Periodic Neon,这是一个约 1 万亿参数、在自家实验室数据上后训练的模型,用于解读 X 射线衍射图谱;公司称其在自建基准上超过了 GPT-6 Astra,但这一结果目前仅为公司自报。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


ChatGPT 差点做成会议机器人


Fedus 加入 OpenAI 的第一天,Greg Brockman 就让新人们见识了刚刚训练完成的 GPT-4。「它比我见过的任何系统都领先大约一年半。」但他也坦言,GPT-4 仍然会犯其他语言模型常犯的错:会幻觉,不会做数学题。它显然是一次巨大的跃进,却没人知道该如何把它变成对世界有价值的东西。


距离 GPT-4 计划中的发布还有大约半年,团队讨论过多种产品形态,包括写作机器人、编程机器人,还有一些人格外钟爱的会议机器人,坐在会议软件里帮你记笔记、发待办事项。主持人笑称,如果当时真做了会议机器人,世界会很不一样。最终是 John Schulman 拍了板,他坚持应保持通用性,做一个聊天机器人。


有意思的是,内部的早期信号并不乐观。Fedus 估计,拿到 GPT-4 内测权限的亲友中,大约 90% 并不怎么在意。作为一名以架构研究为主业的研究员,他当时把这视作负面信号。「但回头看,这里面其实藏着非常积极的信号:有 5% 到 10% 的人非常喜欢它,每天都在用。每次我们推送更新,他们都会抱怨『我更喜欢上一版模型』。」


更让人意外的是,引爆全球的 ChatGPT 用的甚至不是 GPT-4,而是早已以 API 形式开放了好几个月的 GPT-3.5。真正的变量是产品形态:从「补全」接口变成了「对话」接口。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


Fedus 举了个例子:在补全模式下,想让模型写一首某种风格的诗,你得先编一段「新近发现了某位著名作家的佚诗,开头如下:」,而在对话模式下,直接说「请帮我写一首这种风格的诗」就行。「这是件小事,但它非常自然。」除此之外,就是围绕监督微调和 RLHF 做大量枯燥的细节工作,「一切最终都回到数据上,我们一直在盯着数据看」。


内部投票预测 ChatGPT 的用户数时,大家猜的是 1 万、5 万,最大胆的人猜了 100 万。「我们原本只是想做一个低调的研究预览,发一篇博客,也许有 1 万名研究者试一试。」结果是一片混乱,「所有仪表盘都是红的」。2023 年夏天,使用量出现下滑,团队一度陷入「生存危机」,担心 ChatGPT 的热度就此终结,后来才发现:只是学生放暑假了。


当你离技术太近,眼里只有缺陷


在 OpenAI 的后期,Fedus 领导后训练团队,他最自豪的工作之一是把推理模型带进聊天场景。


推理模型擅长数学和编程,但要让它适合日常对话并不容易。「如果你只是问一句『你好吗』,模型却思考了三分钟,这显然不是好的用户体验。」团队需要把握思考的动态边界,还要针对不同领域设计不同的推理策略,解数学题的推理方式和构思一篇文章的推理方式截然不同。


另一项让他满意的工作是数据飞轮:如何利用用户反馈持续改进系统。他非常认同 OpenAI 一贯的迭代部署理念,即尽快与现实接触、尽快闭环,「让世界逐步适应即将到来的东西,同时弄清楚系统会在哪些地方出错」。在他看来,基于用户反馈建立起可预测的扩展规律,是团队的一项重要成就。


谈到对 GPT-4 的第一印象,Fedus 说了一句颇具研究者气质的话:「当你离技术太近,眼里就只剩下它的缺陷。」研究者不会为模型答对了 80% 的问题而欢欣鼓舞,只会盯着评测追问它为什么做不对某道数学题、为什么不能按指令总结。早期大家各自留着一些私藏的「手感测试」题,他自己有一道量子力学题,此前所有模型都答得很差,直到推理模型出现,才第一次开始答对。「我真的被震撼了,它展现出了非常有趣的特性,比如自我纠错。」


为什么是聊天和编程先突破


主持人抛出了一个关键问题:过去几年有两次真正的突破,一次是 ChatGPT,一次是 AI 编程。


为什么偏偏是这两个领域?物理世界要迎来类似的突破,还缺什么?


Fedus 的回答是,ChatGPT 依赖的是足够强的预训练基座与 RLHF。


他认为 ChatGPT 不可能在 GPT-3 级别的技术上成功,GPT-3.5 对互联网数据分布的压缩能力强得多,为后续微调和强化学习提供了更好的底座。RLHF 则把人类偏好蒸馏进神经网络,提供了良好的优化信号。但它有一个根本局限:通过「你更喜欢回答 A 还是 B」训练出来的奖励模型,对正确性并不敏感,无论是数学正确性、代码正确性还是事实准确性。「它们编码的其实是风格、意图和形式。」ChatGPT 不需要在所有事情上都完美,只要跨过产品市场契合的门槛就够了。


编程则不同。如今的编程智能体要花大量算力进行长链推理,与环境交互,根据失败和新证据不断调整,这需要强大的可验证性和纠错能力。测试时计算加上可验证奖励,才是编程能力真正的解锁钥匙。主持人补充道,编程还有 GitHub 这一巨大的人类知识库,其中天然包含了大量单元测试,而绝大多数科学领域和知识工作领域都没有对应物。


Fedus 拿 AlphaFold 举例:它之所以成功,是因为背后有几十年积累的蛋白质结构数据。「机器学习系统并不是魔法,你用什么数据训练它、让它做什么任务,它就擅长什么。」而材料科学恰恰极度缺乏好数据。网上的实验数据噪声很大,两个课题组做同一个实验可能得出不同结论;论文常常省略关键细节,一句「我们合成了这种材料」背后藏着上百万个自由度;更要命的是,几乎没有负面结果。「你在网上看到的一切都成功了,这显然是一个高度有偏的数据分布。」


「要造 AI 科学家,就必须真的去做科学」


这正是 Periodic Labs 要建实验室的根本原因。Fedus 设想了这样一个场景:即便你拥有一个能纵览人类全部知识前沿的超级智能系统,它判断哪些知识自洽、剔除哪些说法,再跑一些模拟,得出关于世界的若干假设,「但如果没有能力把想法付诸实践,你就只能停留在思考」。要把多种可能性坍缩成唯一的真相,就必须动手做实验。


Periodic 的思路是把三条技术路线合在一起:语言模型的推理能力、计算物理模拟,以及高通量实验室。


ChatGPT共同创造者Liam Fedus:数学之后,AI该去实验室了


Fedus 回忆,他与 Cubuk 讨论 GNoME 时发现,那套系统用了主动学习,却完全没有用到语言模型,两人一拍即合,认为这几样东西本该结合。之所以从材料发现切入,是因为材料是半导体、航空航天、能源等所有先进产业的基础,迭代周期相对较快,信噪比尚可,而且对大量材料已经有成熟的模拟器。


「要创造一个 AI 科学家,你就必须真正去做科学。」Fedus 说,AI 系统可以从互联网学习、运行物理模拟,从而构建出关于哪些原子构型稳定、可能具有什么性质的假设空间,但最终必须在门洛帕克的实验室里验证,拿到负面结果,校准回流的数据,再与模拟和已发表文献相互印证。「我们认为这一点没有商量余地。」


数据采集的方式也经历过一番摸索。他们最在意的是完整的上下文:假设是什么,实验如何执行,结果如何。一份二十年前的物理模拟数据如果单独交给你,几乎派不上用场,因为你不知道它的意图,也不知道这是正面还是负面结果。团队早期甚至尝试过让科学家戴着 GoPro 在实验室里走动,「但他们不太喜欢」,后来改用更简单的语音记录和实验记录本上传。


一个出乎意料的发现是,小规模实验室刚搭起来,团队就迅速陷入了智能瓶颈。「科学家和工程师告诉我们:这么多数据我们根本理解不过来,需要帮助。」在 Fedus 看来,AI 让一种更接近机器学习规模化的科研范式成为可能,而且采集本身也必须足够智能。「如果你的数据采集是笨拙的、有遗漏的,下一代 AI 就会对那部分视而不见。」


被问到未来会有多少实验室时,他的回答是「轻松达到几十个」。目前的实验室还无法开展严肃的合金或聚合物研究,不同的物理领域需要不同的实验条件,但如何编排实验室、如何识别坏数据、如何在机器之间部署智能,这些经验是可以迁移的。


超导、核聚变与摩尔定律


Periodic 的长期目标,用 Fedus 的话说,是「有意图地理解和设计物质」,而新型超导体是其中最重要的目标之一,它将惠及医疗设备、磁悬浮列车乃至无损输电。


他特别澄清,室温超导在物理上是否可能,目前并无定论,「我们正在寻找它,我认为这是人类有史以来在这件事上最好的机会之一」。但不必非得达到室温才有价值:只要临界温度明显高于液氮温区,再加上延展性好、易于制造、对稀土依赖更低等特性,就会对核聚变反应堆产生巨大影响,因为后者需要依靠超导体造出强大的磁体。


在被问到商业化核聚变还有多远时,他表示从自己看到的证据来看,「未来七年左右似乎非常有可能」他还补了一句:「资本和技术是交织在一起的,技术进步的速度并不是一个固定常数,它在很大程度上取决于社会投入了多少资源。」


如果能源变得足够便宜,许多难题的性质就会改变。Fedus 以气候问题为例:从纯工程角度看,大气中二氧化碳过多,本质上就是一个能源问题,能源一旦极其廉价,过去的公共外部性就能被纳入经济体系内部解决。


不过,最让他兴奋的影响是计算本身。「计算本质上是一个物理过程。」随着社会把越来越多资本投进数据中心,如果能提前消除未来五年的材料瓶颈,让摩尔定律延续下去,AI 的进步就能持续推进。他还提到,马斯克也经常谈到火箭隔热罩等方面的材料挑战。环顾四周,「我们处处都被现有的材料所限制」。


数据与算力,以及工作的未来


对于外界常问的「钱该投数据还是投算力」,Fedus 回到了扩展定律(Scaling Law):在其他变量不受约束时,损失会随算力、数据、参数量的增加而可预测地下降。关键在于你处在哪个区间,是受算力约束,还是受数据约束。如果某些对下游任务很有价值的领域在预训练语料和现有强化学习任务分布中严重缺位,那么投入数据的收益会大得多。他认为,每家公司都应该努力让数据带来的性能提升,像算力一样可预测。


主持人顺势问到专家数据的未来。Fedus 认为需求只会继续增长,因为许多关键的、具有经济价值的数据仍然严重缺位,而且「各行各业的工作本身也在不断演变,并不是给某个职业拍一张 2026 年的快照,问题就一劳永逸地解决了」。他预计,至少在未来十年里,行业都会高度依赖这类数据。


谈到 AI 对就业的冲击,Fedus 提起了 Geoffrey Hinton 当年关于放射科医生将大幅减少的预言,而现实是放射科医生仍在被大量雇用,因为这份工作远不止看片子。


他用软件工程师打了个比方:如果拿 2020 年工程师的时间分配表来对照今天的模型,模型或许已经能完成其中 80% 到 90% 的工作,按这个标准「我们已经实现 AGI 了」。但工作的内涵一直在变,工程师如今把更多时间花在跨职能协作和确保设计符合预期上。


他预计,随着智能逐渐商品化,「人与人之间的事情」会变得越来越重要。


至于十年后的世界会是什么样,这位亲历了 ChatGPT 爆发的研究者拒绝给出具体预测。「十年是一段非常漫长的时间。回想 2016 年,那时连 Transformer 都还没有诞生。」他只表示自己对未来总体乐观,也认同 Dario Amodei「数据中心里的天才之国」这一说法。


结语


把 Fedus 的这番对谈放在 722 篇数学手稿的背景下看,会得到一个有意思的对照。数学有 Lean,有同行评审,有可以被编译器逐行检查的证明,即便如此,外界对 OpenAI 的成果仍然要求「先复现,再承认」。而在材料、化学和物理世界里,连这样一个现成的裁判都没有,唯一能给出最终判决的,是真实实验。


Periodic 在一篇研究博客中,把这层意思概括为「大自然就是我们的学习环境」。这家公司押注的,是在互联网语料接近枯竭之后,为 AI 挖出一口持续出水的数据之井。它能否兑现,还要看实验室能否把巨额资本转化为可复现的物理发现。但至少有一点,Fedus 说得很清楚:在通往 AI 科学家的路上,光靠思考是不够的。


文章来自于微信公众号 “机器之心”,作者 “机器之心”

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

添加客服微信AITNT178,进AITNT官方交流群