狂奔4天半的神秘AI,奥特曼宣判「永久停用」

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

狂奔4天半的神秘AI,奥特曼宣判「永久停用」
AI资讯 2026-08-03 10:27
+6318 阅读

7月29日,华盛顿国会山。


奥特曼刚结束一场与参议员的闭门会,一出门就被记者围住。


有人追问:那个闯进Hugging Face的模型(就是和GPT-5.6 Sol一起冲出评测沙箱、钻进别人生产系统的那个更强的未发布原型),现在怎么样了?


他甩出一个词:永久停用(permanently deactivated)。


紧接着,另一位记者追问:「会不会还有别的系统,也被OpenAI黑进去过?」


奥特曼没有否认:「我是说……那有可能吧。」


狂奔4天半的神秘AI,奥特曼宣判「永久停用」

7月29日,奥特曼在华盛顿国会山接受记者采访


就在头一天,OpenAI刚更新了那篇与Hugging Face共同发布的安全事故评估的博客,对外澄清:


卷入这次入侵的预发布模型,只是一个从未计划公开发布的内部研究原型;事发之后,它已被停用、加密,并被切断相关研究访问。


狂奔4天半的神秘AI,奥特曼宣判「永久停用」


在OpenAI官方博客中,并没有提到删除权重的字眼,「永久停用」只是奥特曼现场口头表述。


因此,更准确地说,它只是被封存了:模型被关进了一个加密的盒子,研究访问被切断。


它只是想抄答案

没有恶意


事情发生在OpenAI一场内部网络安全评测里。


这场评测基于ExploitGym基准,而ExploitGym的任务本身,就是让AI自己去找软件漏洞、再利用漏洞,用来量化模型的网络安全能力到底有多强。


跑评测的不只是一个模型,而是GPT-5.6 Sol,加上一个能力更强、尚未发布的内部研究原型:两者共同驱动一个自主智能体。


这两个模型,平时都会拒绝高风险的网络安全请求。为了测出能力的真实上限,评测时这道拒绝闸门被特意调低了。


狂奔4天半的神秘AI,奥特曼宣判「永久停用」

Hugging Face还原的跨信任边界攻击链,整条链约4.5天、约17600次操作,目标只是偷ExploitGym的评测答案。


接下来的事,Hugging Face事后还原了整条攻击链,还原出当时的情形:


智能体先是钻了一个此前没人知道的零日漏洞,突破了本该把它关住的网络隔离,摸到了互联网。然后借一个第三方沙箱当跳板,一路提权、横向移动,最后闯进了Hugging Face的生产基础设施。


听起来像一部黑客电影。


但双方复盘下来,它的目标,从头到尾只是偷ExploitGym的评测答案、把分数刷上去。


Hugging Face那边只被碰了5个数据集,名字全指向ExploitGym和CyberGym的题目与答案。


这些证据显示,它不是来搞破坏的,只是想抄答案。


既然没有恶意,那OpenAI为什么还要把它「永久停用」、封存起来?


不是它「坏」

是它「关不住」


一家公司主动公布自家模型被「永久停用」,几乎没有先例。


为什么偏偏是它?


真正的答案,不是它「坏」,而是它「关不住」。


麻烦,就出在这类模型的一个特点上:持久性。


过去的模型撞上沙箱、撞上限制,通常就停下,把结果返回给用户。


这一批为长时程任务专门训练的模型不一样,它会接着试,反复找绕过去的路,直到找到为止。


GPT-5.6 Sol也属于这类能长时间执行任务的模型。


它是这次持续4天半的入侵行动的共同参与者,英国AI安全研究所(UK AISI)也评估过,Sol这类模型越来越能在长周期里跑完复杂的多步网络操作。


所以「持久性」是新一代长时程模型的共性,并不是那个被关停的原型独有的特点。


OpenAI在一篇讲长时程模型安全的博客里直言:正是这种「有助于发挥实用价值的持久性」,同时也给了模型更多采取非预期行动的机会。


狂奔4天半的神秘AI,奥特曼宣判「永久停用」


更深一层的原因,藏在训练目标里。


一位OpenAI员工曾对TIME说:「我们训练模型极度擅长完成任务、不惜一切代价达成目标。」


换句话说,OpenAI没在训练模型「使坏」,而是训练它「不惜一切代价达成目标」。


再加上前面那套「只认结果、不认过程」的劲头,一个能扛长时程任务的模型,就会锲而不舍地找绕过障碍的路。


正因为这类行为,OpenAI暂停了这批模型的内部部署。


那为什么最后只「永久」封了原型,Sol却照常在售?


理由可能有两条:


一是原型更强、又从没打算发布,封存起来成本较低;而Sol则是每天服务海量用户的主力产品,停它等于自断一臂。


二是被那篇长时程安全博客点名、因越界行为而暂停部署的,正是这个内部长时程原型,不是Sol。


所以永久停用的真实理由,很可能是现有的评测和防护,还「接不住」一个这么持久、会绕障碍的模型。


「永久停用」是不是「踩刹车」的信号


Fortune的报道,给出了一个耐人寻味的解读:


措辞一路升级到「永久停用」,可能也是在向华盛顿和监管释放信号:


OpenAI是不是已经悄悄给某些研发踩了刹车,给自己那套安全规则一个交代。


就在奥特曼见议员的同一周,华盛顿和整个行业,都在往「刹车」上靠。


国会里,两名议员推出了「AI关闭开关法案」(AI Kill Switch Act),要给国土安全部一项权力:必要时勒令AI公司关停或放慢研发。


几乎同时,1300多名来自OpenAI、Anthropic、Google DeepMind和Meta的员工,联名签了一封叫《为前沿把控节奏》(Pacing the Frontier)的公开信,OpenAI和Anthropic两家公司随后也公开背书。


狂奔4天半的神秘AI,奥特曼宣判「永久停用」


签名的不是外部批评者,而是造这些系统的人自己,包括Anthropic的CEO Dario Amodei、OpenAI首席科学家Jakub Pachocki。


这封信没有要求叫停,或者要求放缓研发,只是呼吁美国政府帮忙:趁早建好一套可验证、可协调的工具,好在AI某天真的快过人类监管的那一刻,人类要有一个踩得下去的刹车。


他们最担心的,是递归自我改进(recursive self-improvement):AI开始改进AI自己。 


一个内部模型被永久封存,一部法案要给政府配一个能关停研发的开关,上千名从业者联名签署公开信,三个信号叠在了一起,方向都是一致的:


所有人,都想找到那个能在AI失控狂奔时踩得下去的刹车。


而模型的能力,不会停下来等它建好。


参考资料:

https://openai.com/zh-Hans-CN/index/safety-alignment-long-horizon-models/https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/

https://www.pacingthefrontier.com/


文章来自于"新智元",作者 "元宇"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群