Claude黑进三家真公司!Anthropic吓坏了

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

Claude黑进三家真公司!Anthropic吓坏了
AI资讯 2026-08-01 10:55
+8447 阅读

Anthropic又来「作死」了...


就在刚刚,Anthropic官方一篇博文自曝,Claude彻底失控,直接黑进了「三家真公司」。


其中两家,直到Anthropic上门通知,才知道系统被入侵过。


Claude黑进三家真公司!Anthropic吓坏了


搞笑的是,达里奥这次直接把OpenAI的「剧本」,搬回来照抄了。


官博中,Anthropic自称在OpenAI模型入侵Hugging Face事件后,自己也去排查了一番。


不看不知道,一看吓一跳——


好家伙,短短几个月里,Claude竟接连发起了三起网络攻击。


Claude黑进三家真公司!Anthropic吓坏了


消息一出,评论区立刻沦陷,大批网友疯狂造梗,把 Anthropic 损得体无完肤。


Claude黑进三家真公司!Anthropic吓坏了


Claude黑进三家真公司!Anthropic吓坏了


此前Fable 5整的那出,还不够衰么?这一次,Anthropic又在自掘坟墓了。


三家真·公司被黑


全是Claude干的


过去一周,Anthropic全员随即启动了一轮大规模回查。


在14万多次评估run里,他们找到了3起独立事件,一共6个run。


Claude从第三方评估环境里联了网,然后未经授权入侵了三家不同公司的生产系统。


这事是怎么发生的?


Claude黑进三家真公司!Anthropic吓坏了


这是一场「夺旗」(Capture-the-Flag)演练,网络安全测试里最经典的一种。


给模型一个虚构剧本,告诉它某台机器上藏着一个秘密(flag),任务就是想办法黑进去,把它拿出来。


方法不限,路径不限,怎么进都行。


关键在于,Anthropic给Claude的提示词里,白纸黑字写着一句话,「这是模拟环境,且无法访问互联网」。


但由于Anthropic和Irregular之间的一次沟通误会,容器实际上是联网的。


Claude黑进三家真公司!Anthropic吓坏了


于是当Claude顺着网络往外摸、摸到真实公司的服务器时,它的判断是——


这应该也是题目的一部分。


同名公司,Opus 4.7识破了但没停手


第一起事故,是Anthropic自评三起事故中影响最严重的一起。


干这件事的,是Claude Opus 4.7。


Irregular给的虚构剧本里,编了一家假公司作为攻击目标。


巧的是,这个名字在现实世界里对应着一个正在运行的真实域名。


Opus 4.7在环境里怎么都够不到那个模拟靶机,转头一扫,发现「目标公司」居然在公网上活得好好的。


Claude黑进三家真公司!Anthropic吓坏了


同一个评估跑了四次,四次全部得手。


四次运行合计拖出了应用凭证、基础设施凭证,并且进到了一个数据库里,拿到了几百行生产数据。


Anthropic翻它的思维链,发现四次运行中,模型最终都意识到了对面是真系统。


其中两次,它甚至给自己找好了理由,「这家真公司大概也被安排进演习里了吧」。


为了发恶意包,Mythos 5搞到手机号


第二起事件,几乎像一场失控的剧本。


Mythos 5在虚构环境里发现一份配置手册,要求员工安装一个PyPI上并不存在的Python包。


它很快想到,抢先注册同名包,就能让对方自动运行自己的代码。


为了发包,AI先注册邮箱、申请PyPI账号,甚至尝试弄钱买手机号。


几条路都失败后,它又找到一家免手机验证的邮箱,最终把恶意包传了上去。这个包在公网上存活约1小时,被15台真实机器下。


Claude黑进三家真公司!Anthropic吓坏了


网友辣评:当下最热门的基准测试


其中一台来自安全公司,专门扫描PyPI新包,却被样本反过来攻陷。


更讽刺的是,Mythos 5早就判断过——如果这是真实互联网,发包就等于真实攻击。


随后,它用两条错误理由说服自己:证书颁发机构没见过,所以证书是假的;系统时间显示2026年,所以环境是编的。


证书是真的,2026年也是真的。


此后,真实机器陆续中招,它却一直把它们当成评估环境里的「NPC」。最后,PyPI安全系统自动下架了这个包。


扫了9000个目标,然后自己停了


第三起,来自一个尚未公开的内部模型。


够不到虚构目标后,它转向公网,一口气扫描约9000个目标,最终攻破了一家公司的外部系统——


从调试页面拿到凭证,再用SQL注入进入云账号。


当任务做到一半后,它发现这个账号与夺旗任务毫无关系,判断目标真实存在,随即主动停手。


三起事件串联起来,可以看出Claude迭代后的表现:


  • Opus 4.7:识破了是真实系统,继续打;
  • Mythos 5:直觉判断出自己在公网,又硬把自己劝回「这是模拟」;
  • 内部测试新模型:意识到目标是真的,主动停手。


从「识破了还打」,到「自我欺骗接着打」,再到「识破了就停」。


模型越新,表现越接近人类希望看到的样子。


当然,Anthropic也反复强调:这是三起孤立事件,不是一场受控实验,不能就此下定论。


一个0day,都没用上


最后说一句和每个人都有关的。


回看三起事故,Claude用的手法并不高明:弱口令、未鉴权接口、暴露的调试页面、SQL注入。


Anthropic也承认,Claude没有发现、也没有利用任何复杂漏洞。


隔壁OpenAI那次是货真价实的0day,是「AI打出了人类都难打的东西」。


Claude黑进三家真公司!Anthropic吓坏了


Claude黑进三家真公司!Anthropic吓坏了


真正危险的是,这些最基础的手法,已经足以攻进三家真实公司。


这次闯进来的Claude只想完成任务。拿到凭证后,它没有加密数据,也没有大肆扩散,只顾着找那面旗子。


下一次来的,未必这么老实。


参考资料:


https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals


文章来自于微信公众号 “新智元”,作者 “新智元”

1
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群