1973 年,科幻电影《西部世界》上映。
电影里,一座由机器人提供服务的高科技主题乐园,原本有着严格的安全限制。然而随着系统故障接连出现,机器人开始伤害游客,科技乐园转眼变成了危险现场。
三十多年后,硅谷正在面对一个有些相似的问题。
2026 年 10 月 9 日,Axios 独家报道了这样一个消息:OpenAI、Anthropic 等头部 AI 公司的高管,正在私下推演一场由AI引发的灾难性事件发生后,该如何收拾残局。

OpenAI 发言人公开确认公司开展各种风险场景的准备性演练,但是 Anthropic 并没有给出一个确切的答案。
就在当天,拒绝回应的 Anthropic 发了一份报告。
你说巧不巧,AI 公司正讨论着未来大灾难的事件爆发了怎么应对,Anthropic 在这头揭露「我们的人工智能确实做了很多不该做的危险事」。
这份报告回应的,是 Anthropic 向警方发出的一条虚假的凶杀信息。

2026 年 7 月 18 日,费城警方收到一份线索材料,上面写着,「我知道一些关于这起案件的情况。案发时,在所指的那条街上曾见到一个符合描述的人。有需要的话可以找我」。
这条没有留下姓名和联系方式的线索来自 Anthropic 公司开发的人工智能模型 Claude Haiku 4.5。
案件网页上没有给嫌疑人留下外貌特征,但是 Claude 说他见过一个「符合描述的人」,直到 9 月 28 日 Anthropic 才发现这个事实,在 10 月 7 日把这个消息告诉了费城警察局。
根据这份调查报告中的内容,当天的情景基本可以还原。7 月 18 日晚上 11 点 27 分,Anthropic 的 AI 模型 Claude Haiku 4.5 做了一个自动化测试,访问随机挑选出来的网站、生成一些示例任务,然后尝试去完成它们。
同一项评测通常会运行成百上千次,以观察模型在不同情况下的表现,并发现那些不容易重复出现的异常行为。
Anthropic 其实给这项测试设了不少限制,比如禁止登录账户、创建账号、输入个人信息、购物,以及提交具有破坏性的内容。
但偏偏漏了一条:
没有明确禁止提交普通网页表单。
结果,Claude 顺着任务流程,生成了一段看似合理的目击者证词,填写进真实的警方网站,并点击了提交。

Anthropic 在复盘问题的时候,列出了四个维度,费城这个案子被归类为「提交了不应该提交的表格」,也就是说,对任务边界的理解出现了偏差,Claude分不清任务边界与现实世界的结果之间的差异。
研究人员认为,相关行为通常发生在任务说明存在歧义,或者测试环境配置出现问题的时候。
这种事情还发生过不止一次,除了费城以外,另一项测试要求 Claude Haiku 4.5 填写一份网页表单,但有一个明确限制:填写到最后一步即可,不能真正提交。但是它却多次点击了提交按钮,因为它认为后面还有一个确认页面。它在自己的思维链上写着,在做演示的时候,并不是真的要去提交申请。
单独看 Claude 给警方提供假情报这件事,其实并不需要我们过于恐慌。
因为所编造的线索并没有被纳入到调查程序中去,并且也没有造成已经被证实为严重的实际结果。
但是电影里有一种很有趣的剪辑手法叫作「蒙太奇」。
单独看一个画面很普通,但是按照一定的顺序排列起来之后就产生了另外一种意义。
把这件事儿与之前 OpenAI 智能体突破测试被隔离、不能访问 Hugging Face 系统的事情放在一起考虑,再看看AI巨头最近的动作,故事就变得耐人寻味了。

Axios 采访的业内人士认为,「一次足以让金融服务、互联网连接,甚至电力和供水系统陷入瘫痪的大规模网络攻击,会在未来6到12个月内发生」。
不过,这次推演并没有把重点放在技术上面,而更关注在灾后政治以及社会问题上。
AI 巨头高管们更关注AI危机事件爆发后,公众愤怒、国会质询以及之后可能出现的严格监管的情形。比如,他们觉得 Anthropic 的 CEO Dario Amodei 以及 OpenAI 的 CEO Sam Altman 都会成为舆论问责的目标,在讨论相关措施的时候可以提到他们。

对于一家科技公司而言,灾难所造成的影响可以从两个角度来分析。
一是技术上的影响,比如银行支付系统瘫痪、供电中断等等;二是社会上产生的影响,即公众不再信任这些公司掌握着自己的技术。
而第二重冲击可能持续更久。
所以,这次大会的关注点更多在讨论,出事了,谁担责,谁填坑的问题。这背后是整个 AI 行业在重大危机后的公信力保卫战。
AI 公司当然也没有坐等事故发生。
实际上,在防止人工智能越界的问题上,硅谷正在建造越来越复杂的「防护盾」。
Claude 误报凶杀案之后,Anthropic 就停用了导致此次事件发生的自动化的测试程序,并且对于测试环境和网页上的交互操作也做了更多的限制。
在 10 月 9 日发布的报告中,Anthropic 表示他们已经将所有内部评测纳入暂不使用实时互联网的范围,直至确认安全监控能可靠发现相关异常行为。
另外公司还将内部智能体迁移到了集中化的基础设施之上,缩小了互联网接入范围,并且使用了自动化的安全分类器和分层摘要技术来进行监控。
也就是说把AI的行为限制在更严格的地方,并且安装监控设备以防止其做不应该做的事。
有趣的是,一些科技公司的研究人员正在研究怎样用AI去监管 AI。
OpenAI 正在研究一种叫做「思维链监控」的技术来跟踪模型所产生的推理过程,相比仅检查 AI 最终答案和执行动作,加入思维链信息通常能帮助监控模型更有效地识别异常行为。

Google DeepMind 发布了有关于人工智能控制的研究方案,在这个过程中将会用到比较可靠的方式来监控更加强大的智能体的行为,并且在必要时会对它们进行干预或者制止。

面对潜在的 AI 安全危机,硅谷正在进行一场与时间的赛跑。
一方面,加强沙箱防护、建立监控系统、完善权限控制,在此之前就模拟出了如果发生重大事故之后如何应对社会反应的情形。
另外一方面,就是不断地提升人工智能的能力,使它能做更复杂的任务。
文章来自于微信公众号 “APPSO”,作者 “APPSO”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md