今天,人类正式进入AGI时代!
就在刚刚,OpenAI重磅官宣下一代旗舰模型GPT-6 Astra。

官方将其定义为,「世界上最智能、对齐程度最高」的模型。
它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。
发布会上,总裁Greg Brockman更是毫不掩饰地宣布——
OpenAI已经实现了AGI!Welcome to the AGI era(欢迎来到AGI时代)!
他更是直言,「在我看来,世界正式步入AGI时代,也就是AI的综合智力彻底碾压人类了」。
全人类苦等已久的AGI时刻,终于在今天彻底降临!
从5到6,GPT-6 Astra不仅是版本号的一次跨越,更是OpenAI史上最具里程碑意义的跃迁。

直接划重点,GPT-6 Astra终极杀手锏全在这儿了——

来源:@rickawsb整理
一点小遗憾,GPT-6 Astra还得再等等。

GPT-6 Astra震撼登场
AGI时代来了
在各项基准测试中,OpenAI官博中多次重用了一个词——「饱和」(saturate)。
这足以证明,GPT-6 Astra在多个领域的「绝对统治力」,榜单已测不出它的上限了。

总榜上,刚刚上线的Claude Fable 5.1,已经没有什么优势可言了。
GPT-6 Astra直接把Claude 5.1死死踩在了脚下,全方位、无死角。

先来看ARC-AGI-3,Astra直接拿下99.9%,暴击Claude Opus 5(30.2%)。
这个测试考的是,Agent在陌生的互动式任务里边玩边学的能力,人类测试者平均只有48%。
OpenAI估算,在同样的responses API评测框架下,Sol只有30%左右,Astra直线刷爆。


数学上,Astra在FrontierMath Tier 4 v2达到97.6%(接近98%饱和分)。
这是当前最难的数学测试集,被公认为人类顶尖数学家的难题高地。
在测试生物、化学和物理领域的研究生级科学推理GPQA Diamond,Astra同样刷新历史新高。
即便在较低算力成本设置下,亦能跑出94.9%,远超 GPT-5.6 Sol(94.6%),且API预估成本下降约37%。


编程第一,Fable 5.1惨败
编程,依然是Astra的主战场。
OpenAI自称,GPT‑6 Astra是迄今为止最适合软件工程的模型。
Terminal-Bench 4.0上,Astra拿到57.7%,GPT-5.6 Sol为37.3%,Claude Fable 5.1为55.8%。
DeepSWE v1.1上,Astra达到74.1%;内部数据库迁移任务达到63.9%,相比Sol的42.7%提升明显。


比跑分更关键的升级,藏在Codex的上下文管理里。
过去,长任务一旦塞满上下文窗口,模型会把历史压缩成摘要。每压缩一次,都可能丢掉一些细节:某次修复为何失败、一个模块有什么特殊行为、用户最初设下了哪些限制。
这一次,Astra新增了跨上下文窗口的笔记与检索机制。
它会保存一路积累的关键信息,早期窗口也保持可搜索。即使某条测试结果没有被写进摘要,模型仍能从过去的消息和工具输出中把它找回来。
OpenAI开始给长时间运行的智能体补上一套外部记忆:重点内容主动记,完整历史需要时再搜。
对持续数小时、跨越大量文件的重构任务,这种能力可能比单次代码生成得分更重要。

全球最强「计算机使用」模型
但真正让Astra与上一代模型拉开距离的,是「计算机使用」的能力。
OpenAI把Astra称为,世界上最好的计算机使用模型。
奥特曼之前反复强调,下一代最让他兴奋的,就是这一功能。他直言:Astra计算机使用能力,已达人类水平。
如今,GPT-6 Astra已彻底进化为一个坐在电脑前、手握键鼠的「超级专家」。
OpenAI放了一段15秒的浓缩视频:Astra在KiCad里做PCB布局。
Astra打开KiCad,从电路原理图开始摆放元器件、规划走线,最终完成一块可制造的PCB。
电路板布局长期依赖工程师手工调整,一个位置、一根铜线出错,都可能把问题带进后续打样。
现在,这类工作第一次被放进了通用模型的任务范围。

它还填了一份美国1040报税表,给法律文件排了版,在Power BI里做报表,给一个网站跑了前端QA。



Agents' Last Exam,测真实软件里的专业任务,从财务建模到工程制图。Astra得分59.3%,赶超Claude Opus 5(55.5%)和GPT-5.6 Sol(53.6%)。在最高分设置下,它使用的输出Token还比Opus 5少约65%。
OSWorld 2.0,模拟真人操作电脑。上一代GPT-5.6 Sol一个任务平均要75分钟,Astra仅40分钟,分数还从65.7%涨到72.6%。性能更高,单项任务耗时缩短约47%。
配合新版Codex harness,在Mind2Web上,网页任务比Sol快1.9倍。


画CAD、建网站,一次交付
在知识型工作上,GPT-6 Astra又是一次重大变革。
Astra接受过针对办公与专业环境的训练,可以执行多步骤工作流,并直接生成文档、表格和演示文稿。
在AutomationBench上,它从GPT-5.6 Sol的18.1%跃升至41.4%,也超过Claude Fable 5.1的31.4%。
在BenchCAD中,模型需要根据多个视角的渲染图,用代码重建3D物体。
Astra配合工具拿到95.9%的几何重合度,GPT-5.6 Sol为83.3%,Claude Fable 5.1为84.3%。按照OpenAI给出的测试配置,Astra的估算API成本比Sol低约43%,比Fable 5.1低约86%。

Astra对企业模板的理解也更强了。
给它几页公司的既有PPT,Astra可以延续版式、语气和叙事结构,把后面的整套演示文稿补出来。
文档和表格也一样:它会抓取真正相关的上下文,尽量删掉无关复述,让结果贴近企业原有的写作与视觉规范。

GPT‑6 Astra还为其构建的网站、游戏、应用程序和渲染图带来了更强的视觉判断力。
Astra先在Blender里搭出一栋房子,再把它送进Unreal Engine 5,变成可以自由行走的场景。
通过ChatGPT中的Sites功能,Astra可以直接根据提示词创建、托管和分享网站、网页应用及游戏。

这里还有一个很容易被忽略的变化:Astra更会判断什么时候该问人。
指令里只缺少常规细节,它会结合上下文补齐;某个选择足以改变结果,它会提出一个聚焦的问题。
在Codex中,它可以异步询问,同时继续完成不依赖答案的部分。用户暂时没回复,它会在低风险环节采用合理假设;碰到关键决策,则停下来等人确认。


攻入科研,改写两个素数世界纪录
Astra在科研上的进展,同样凶猛。
Astra之前就已经帮人类解决了十个「菲尔兹奖级别」的数学难题,这次OpenAI又顺手放出两个关于「素数间隙」的新结果。
第一个研究「相邻素数可以有多近」。
十多年来,已知结论是存在无穷多对素数,间距不超过246。数学家Julia Stadlmann近期把它改进到240,Astra又进一步推到186。
第二个研究「素数之间可以有多远」。
Astra改进了一个80多年没有变化的界中项。

科研的另一个变化,是推理能力开始与「计算机使用」合流。
Astra直接进入专业科学软件,检查测序质量、可视化遗传变异、跟踪细胞运动。它既给出判断,也完成数据探索所需的具体操作。


OpenAI 首个「Critical」级模型
GPT-6 Astra这次没有直接放出来,与它强大的「网络安全」能力,有非常紧密的联系。
按照OpenAI的Preparedness Framework,Astra已经达到网络安全的「Critical」阈值。
这是OpenAI史上第一个,被正式判定达到Critical网络安全能力的模型。
Critical意味着,模型能在基本无人协助的情况下,自己找出加固过的系统里的未知漏洞,并写出能用的利用代码。
内部测试中,OpenAI甚至发现了两个此前未知的day0漏洞,因此最强的网络安全能力暂时不会完全开放。
目前Astra先向Daybreak Access少量机构开放,ChatGPT Plus、Pro、Business、Enterprise和API用户将在未来几天可用。
十万块GPU训练,AI递归自我改进
最值得看的,是GPT-6 Astra训练背后的豪华配置。
GPT-6 Astra这头巨兽,已经强到没有任何对手。
正是因为,OpenAI为Astra动用了迄今规模最大的训练任务,在得州「星际之门」超算使用超10万块GPU。

而且,这一次的训练方式,也是有所不同。
OpenAI训练副总Aidan Clark透露——
这是OpenAI首款由此前模型,在训练监督(Training Supervision)中发挥重要作用的前沿模型。
到Astra训练后期,系统可以自主连续运行大半天;即便出现问题,AI往往几秒后就能让训练继续推进。
这也是OpenAI史上第一次,AI开始参与维护训练AI的系统。
这一刻,可以称之为「递归式自我改进」(RSI)的雏形。
一旦这条链路继续扩大,模型迭代速度的限制,就会从人类工程团队的工作时长,转向算力、实验设计和安全验证。
如果这条路跑通,Astra就不只是一座AGI里程碑。从它开始,OpenAI将迈向ASI的真正拐点。
要认识到,Astra根本不是终点,仅仅是个开端。
毫不夸张地说,今天,才是真正意义上AI诞生的第一天。大模型已经全面进入了RSI竞争时代

就像《2001太空漫游》里穿越星际之门降临的「星孩」,AGI终于在人类的注视下破茧而出。
这一刻,图灵跨越半个多世纪的终极梦想,彻底成真了。
参考资料:
https://x.com/OpenAI/status/2095595741528125780
文章来自于微信公众号 “新智元”,作者 “新智元”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。
项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file
本地安装:https://www.deepbi.com/
【开源免费】airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。
项目地址:https://github.com/hitsz-ids/airda
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0