跳到主内容
@wquguru
精选88宝玉模型发布/更新

主流大模型打星际争霸:均不及人类新手,暴露实时决策短板

有人做了一个"星际争霸"AI 对战测试(Brood War Bench),让当下主流大模型互相打即时战略,结果所有模型的水平都没超过新手。

原文
发到 X
推荐理由

用星际争霸直观检验大模型实时决策与多任务协调能力,结果极具说服力,Agent 开发者必看。

有人做了一个"星际争霸"AI 对战测试(Brood War Bench),让当下主流大模型互相打即时战略,结果所有模型的水平都没超过新手。

《星际争霸:母巢之战》是 1998 年的经典即时战略游戏,也是 AI 研究的老朋友,2019 年 DeepMind 的 AlphaStar 就曾在这款游戏里击败职业选手。但那是专门训练的强化学习 AI。这次测试不同,它让通用大模型以 AI 智能体的形式直接上手操作,看看它们能不能自己建基地、造兵、打仗。

作者 Ben Swerdlow 原本只是做了一个"只能通过智能体操控"的星际争霸版本,拿来和朋友玩。没想到几个几乎没玩过星际的朋友表现还不错——他们说自己就下了句"去进攻"的命令,智能体就自己造了支小部队冲过去了。这让他好奇:如果完全让 AI 自己玩,能打到什么水平?

答案是:很菜,但很有意思。

排名第一的 Codex Astra 打了 18 场全胜,但它最擅长的不是正面作战,而是"骚扰":派一个采矿的工人(Probe)跑到对方基地捣乱。这招对 AI 对手特别好使,因为对面的智能体看到一个工人来了,会花几十秒思考该怎么办,期间什么都不干。而在正经的经济发展和大规模作战方面,Codex 反而比较弱,经常造一两个兵就往对面扔,而不是攒够兵力再出击。

Claude Fable 排第三,胜率 83.3%,是所有参赛模型里最"像在认真打游戏"的。它会老老实实发展经济、爬科技树,甚至在一局里造出了飞龙(Mutalisk),在另一局里研究到了圣堂武士科技。虽然有时候研发做了一堆,兵力没跟上,但至少在"试图理解游戏规则"这件事上,Fable 比谁都认真。

Grok 的表现最差。Grok 4.6 在一场 43 分钟的比赛里输出了超过 11000 个推理 token,却只发出了 6 批操作指令,全程没造过一个战斗单位。它本质上是把即时战略当成了回合制游戏,一直在想,忘了要动手。

这个测试揭示的核心问题是:当前大模型在需要持续观察、快速决策、多线程协调的实时环境中,还远远不够用。即使是表现最好的模型,一个会打"光子炮速推"(一种最基础的快攻战术)的人类新手就能赢下所有比赛。但反过来看,这些模型已经能理解建造、采矿、进攻的基本概念,只是在执行节奏和多任务协调上差得远。

测试的代码和对战平台已经开放,任何人都可以带自己的智能体上去打一局,地址是 http://bw.swerdlow.dev。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件