19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手
AI资讯 2026-09-23 17:15
+9660 阅读

想太多,就连最聪明的AI也会被拖死。


43分钟、11138个推理token、6批指令——0个作战单位。


这是Grok 4.6在《星际争霸:母巢之战》里交出的一张绝望成绩单。


游戏中,把推理拉到最高档位xhigh的Grok,从开局苦思冥想到游戏结束,硬是连一个能上场打仗的兵也没造出来。


而在同一张榜单的另一头,GPT-6 Astra同样火力全开,18战18胜,胜率100%。


这两天,这份名为Brood War Bench的星际大模型榜单,在硅谷程序员扎堆的Hacker News上火了。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

Brood War Bench榜单前10名。Astra开最高推理档xhigh,18战全胜,Grok三个档位全在榜尾。


如今已是OpenAI员工的OpenClaw之父Peter Steinberger,不忘转发为自家模型造势:新榜单来了。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手


AI正在数学圈连破世纪难题,有人惊呼奇点降临,势头猛到让陶哲轩都公开发声要放慢脚步。


可这份榜单的作者Ben Swerdlow,一开篇就甩出一个画风完全不同的判断:


就连全胜冠军GPT-6 Astra,也打不过一个人类新手。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手


Hacker News评论区有人一句话点破要害:「它们不是玩不了,只是需要太多时间。你要是在模型思考的时候把游戏暂停,它就能玩。」


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手


还有人直接开嘲:「搞得好像这些模型不是通用智能一样。」


全网最聪明的AI,为什么会在星际里被自己的思考拖死?


是不是离AGI还远着呢?


游戏永远不会停下来等你


这个榜单的诞生,有点戏剧性。


起初,开发者Ben只是做了个全靠智能体操作的星际版本,拉上几个朋友一起玩。


这帮人几乎没碰过星际,可打起来却一点不输玩了好多年的老炮。


他们的秘诀简单到离谱:只管打字喊一句「进攻」,造兵、集结、开打,全交给AI。


这让Ben不禁好奇:如果人类彻底闭嘴,让这些模型自己玩,它们能活多久?


于是,GPT、Claude、Grok三大家族的19名AI选手悉数登场,一场171局的AI大乱斗就此开打。


比赛跑在Freestyle的云端虚拟机上,每局单开一台机器,同时开打,游戏数据和AI的每一步思考记录全都留了底。


做数学题、写代码,大模型可以发呆5分钟再一次性交卷。


但打星际不行。


这里没有AI习惯的回合制,只有一刻不停的实时战场。


你思考的每一秒钟,对面的农民(英文玩家叫worker,负责采矿的工人单位)都在狂挖矿,兵营在疯狂爆兵,大部队已经朝你家高地冲了过来。


老一代模型还拿回合制的路数打这种即时战略游戏,结果脑子还在转,家已经被推平了。


Steinberger的帖子下,有网友一语道破:


有意思,难怪AI做游戏的时候,总爱做回合制的。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手


Grok苦想43分钟

一个兵也没上场


把这种回合制思维演绎到极致的正是Grok。


在编号G043的对局里,Grok堪称思想上的巨人、行动上的矮子。


它疯狂输出大段大段的战略推理,但43分钟的游戏里,总共只发出了6批指令,平均7分多钟才动一次手。


这不是偶然。


G003里,Grok造了3个机枪兵,始终没走到敌人基地;G002里,它造了2个狂热者,同样没能穿过地图。


兵是造出来了,就是打不到对面。


最高推理档位下它2胜15负,惨不忍睹。


数据曲线很直观:比赛打到11分半,Astra早就兵强马壮,而Grok场上平均只有不到7个农民和几个兵。


搞笑的是,Grok的国库里,其实躺着远超Astra的巨额存款。


钱在兜里,大脑在运转,就是死活不动手。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

Astra的农民和狂热者拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。


在星际这种残酷的战场上,想得久可不叫深思熟虑,叫挂机等死。


Astra的必杀技

让对手想到死


如果说Grok是被自己想太多拖死的,那Astra就是专门逼别人想太多,把对手活活拖死。


Astra所在的Codex家族,最绝的一招是骚扰。


它经常只派一个最基础的采矿农民,横穿整张地图跑到敌人家溜达。在人类玩家眼里,这种战斗力为零的农民随手拉两个工兵就能赶走。


但在AI局里,这招简直是降维打击。


对面的AI只要一看到这个农民,瞬间陷入沉思,花上几十秒去疯狂计算「我该怎么处理这个农民」。


在这宝贵的几十秒里它什么都不干,基地彻底停摆。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

Astra的骚扰部队拆掉了Grok的主基地,Grok手里一个作战单位都没有,账上还躺着928块水晶矿。


在即时战略游戏(RTS)里,骚扰对方是为了破坏经济;到了AI对AI,骚扰的最大杀伤力,是把对面的AI直接拖到宕机。


当然,Astra也有弱点。


它的内部像是一个不和睦的草台班子,管经济的、管造兵的、管打仗的各干各的。


新兵刚造出来就被管打仗的AI拉去前线白给,完全不懂什么叫集结部队。


不过作者也发现,只要他亲自下场当总指挥、把几个子智能体串起来,Astra立刻就懂得攒兵、挑时机了。


Codex家族还有一股顽强劲儿。


有一局,Astra的兄弟GPT-5.6 Terra部队全军覆没,主基地也被拆了。


它把仅剩的一个指挥中心(人族建筑可以起飞)拉上天,一路飘到地图另一头的角落,硬是又撑了6分钟才被消灭。


最像在打星际的是Fable


全场好几局都想让作者替它使劲儿的,其实是游戏优等生Fable。


它的打法最正,老老实实搞经济,踏踏实实发展科技树,很少投机取巧。


有一局它憋出了飞龙;另一局,它把神族一整排高级建筑挨个盖齐,连出高阶圣堂武士要用的圣堂档案馆都造好了。


比赛打到11分半时,农民、兵力、建筑、科技,Fable几项数据都压着Astra。


可好学生未必能拿第一。


Fable虽然胜率高达83.3%排在第三,却依然追不上Astra。


有一局它科技摆满了一桌子,还没等转化成战斗力,就被Claude Opus 5乱拳打死。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

Fable盖满了兵营、重工厂和学院,账上还躺着2800多块晶矿,却被自家Opus 5的枪兵一路推平。


节奏上也差得很远:Astra的对局时长中位数只有8分10秒,爱慢慢种田的Fable,这个数字被拖到了10分37秒。


三个大模型,三种灵魂。


Codex像个满肚子坏招儿的街痞,Grok像考场上死磕第一题的轴学霸,而Fable则是那个翻着攻略逐字逐句照做的老实人。


想得越久

不一定打得越好


既然想太多会死,那是不是脑子越空越好?


也不全是。


GPT-5.6 Sol,推理开到最高档,胜率反而垫底,还不如medium档。


可到了Astra这里,想得越深赢面越大,最高档直接拿下100%胜率。


更有趣的是账单。


Astra开到最高推理档,每分钟只操作12.6次,平均一局只花10.54美元;换成最低档,操作频率翻倍到每分钟25.7次,一局反而要烧掉21.07美元。


最高档位,出手少一半,花钱少一半,赢得最多。这说明新一代模型显然已经进化了。


它们懂得了思考是需要成本的,也知道什么时候该停下脑子去动手干活。


7年前AI赢过职业选手

今天为何打不过新手?


有人肯定会问:7年前,DeepMind的AlphaStar不是早就击败过职业选手了吗?


没错。2019年初,DeepMind公布了AlphaStar的战绩:两个5:0,横扫职业选手TLO和MaNa。


19个AI血战《星际争霸》!GPT-6全胜,照样打不过人类新手

2019年,AlphaStar对阵职业选手MaNa第二局。下方是AI的决策过程:读取局面、判断往哪打、造什么兵,同时预估胜负。


10局比赛,职业选手一局没赢。


后来,DeepMind给它加上了和人类一样的限制:只能通过屏幕镜头看局部地图,每秒能做的操作次数也被压低。


就这样,它又匿名混进欧洲天梯,一路打上宗师段位,超过99.8%的人类玩家。


一边是天梯前0.2%,一边连会光炮快攻的新手都打不过。


难道是AI的技术倒退了?


其实,两者比的根本是两码事。


AlphaStar打的是《星际争霸II》,更像是纯粹的应试机器:靠吃海量录像和疯狂自我对战堆出来的星际特长生,这辈子只学了这一件事。


而今天这些在初代《母巢之战》里对战的大模型,是没有任何星际基础的通才。


它们全靠临场读题、调用工具、现学现卖,而且每一步都得先想完才能出手。


专才打败职业选手并不稀奇,通才想要跨界通关,还要再等等。


文章最后,作者抛出自己的结论:


AI冠军再无敌,也防不住人类新手最爱用的光炮快攻。它们组织不起复杂的阵型,也执行不了长远的战术。


过去几年,我们给AI出的都是回合制考题,问来问去只有一句:你算得对不对?


可星际不一样。它和自动驾驶、具身机器人一样,身处一个不会暂停的世界,对手随时在动。


这场测试,也暴露了AI走向自主行动时最要命的短板:烧掉更多思考token,未必换来更强的智能体。


下一阶段的Agent之争,比的可能不再只是谁想得更深,而是谁能在有限的时间里,把观察、决策、执行连成一个不停转动的闭环。


星际里的翻车,或许就是AI进入真实世界前的一次预演。 


参考资料:

https://bw.swerdlow.dev/report?utm_source=chatgpt.com

https://x.com/steipete/status/2101748820237500557


文章来自于"新智元",作者 "元宇"。

1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群