星际圈这周自己打起来了:一边APM5000碾压职业,一边19个大模型输给新手——看赛党、技术党、模型党,先把三种AI分开再对账

源自1180位全网作者

09-29 20:12

这两周,星际争霸的内容区出现了罕见的"自己打自己":同一个游戏,一边是"史上最强AI对战韩国职业",一边是"大模型被新手的光子炮快攻吊打",两条线的评论区还各说各话、拿对方的结论互相抬杠。看完全网一周的信号后可以确认:两边都没骗人,测的根本不是同一类东西。而这件事恰好给所有RTS玩家递了一套现成的辨别框架——下次刷到"AI碾压人类/AI是智障",先分清是脚本、特化AI还是通用大模型,再决定跟不跟进。

第一本账:碾压职业的那条线——是"操作怪",不是"大脑"。

B站UP主"智商250aaa"从9月中旬开始更新的系列,是星际1特化对战程序(视频标签与简介里写作PLUTO)对战韩国职业选手的实录:9月18日爆炸头、禽兽、屌丝与AI交手,UP在简介里道歉说有几场REP没放出来,“抱歉打了但是REP出错了因此没放最终抱歉是输给了AI”,还写道"AI还是在测试阶段同时重置版据说也快上线了"。 后续一集的标题直接把底牌亮出来:星际争霸1 史上最强AIAPM 5000+大战爆炸头后续,新型自杀AI出现? 同系列"1V4官方AI"的简介写得更直白:几乎可以说正常打不玩阴的正面几乎是不可战胜,理论上教主来也没用。9月27日最新一集"400人口对轰"的简介收尾也留了口子:这个AI"目前来说还是TVT最强,几乎是不败的",但"对地形的利用以及大局观的判断还是存在漏洞"。哔哩哔哩哔哩哔哩哔哩哔哩

这条线最热闹的其实是评论区:高赞质疑问的是公平——“这个ai应该还是调用的接口,而不是通过屏幕画面截屏来读,这个很不公平,限制ai不能调接口,每个兵操作都要发送鼠标和键盘指令,可以看ai第一视角 这样才公平”。 一条9赞长评看完想起柯洁当年泪洒棋场的绝望,感叹"幸好,电子竞技是PVP,而不是PVE"。哔哩哔哩

特化AI的祖师爷也确实有过正式纪录:2019年DeepMind公布AlphaStar对阵《星际2》职业选手TLO和MaNa的对局录像,AI以两场5:0完胜,只有现场赛里MaNa从AI手中扳回一局——注意,那是专门为一个游戏训练的强化学习模型,而且画面是星际2。 下面这张就是那场官方演示的截图(LiquidTLO对阵AlphaStar):游研社

星际圈这周自己打起来了:一边APM5000碾压职业,一边19个大模型输给新手——看赛党、技术党、模型党,先把三种AI分开再对账

换句话说,碾压职业的那台机器,赢在"手":零延迟选中每一个单位、无限APM、多线程齐开。人类输的是生理上限,不是脑子。

第二本账:输给新手的那条线——通用大模型的"手"还没长出来。

9月22日,科技博主"宝玉xp"在微博转发了国外新做的"星际争霸"AI对战测试(Brood War Bench):让当下主流大模型互相打即时战略,结果所有模型的水平都没超过新手,即使是表现最好的模型,一个会打"光子炮速推"的人类新手就能赢下所有比赛。 作者Ben Swerdlow最初只是做了一个"只能通过智能体操控"的星际争霸版本拿来和朋友玩,测着测着就成了这场大模型期末考试。微博

官方榜单截图一共19行,第1名Codex Astra(xhigh档)18战全胜,但最擅长的不是正面作战,而是"骚扰":派一个采矿工人跑到对面基地捣乱——宝玉原帖写得清楚,对面的智能体"会花几十秒思考该怎么办,期间什么都不干",而它自己经济运营和攒兵都弱,常造一两个兵就送。微博

星际圈这周自己打起来了:一边APM5000碾压职业,一边19个大模型输给新手——看赛党、技术党、模型党,先把三种AI分开再对账

排第3的Claude Fable胜率83.3%,是所有参赛模型里最"像在认真打游戏"的:会发育、会爬科技,但常常科技做完了兵力没跟上。垫底的Claude Haiku和Grok在榜单上都是0胜,其中Grok 4.6一场43分钟的比赛输出超过11000个推理token,却只发出6批操作指令,全程没造过一个战斗单位——把即时战略玩成了回合制。 中文媒体转载的对局录屏里,那一格的字幕条写着"Grok 4.6|手里一个兵都没有,主基地被拆":微博

星际圈这周自己打起来了:一边APM5000碾压职业,一边19个大模型输给新手——看赛党、技术党、模型党,先把三种AI分开再对账

顺带一个事实核查的提醒:36氪转载新智元的文章把标题写成"19个AI血战《星际争霸》,GPT-6全胜,照样打不过人类新手",和官方榜单第1行的"Codex Astra"口径对不上,引用名次请以榜单原图为准。36氪

为什么下棋、写代码都封顶的模型,打不开一个1998年的游戏?因为RTS考的不是单点智力,是三样大模型最缺的东西:持续观察下的实时节奏(每多想一秒,战场掉一帧)、经济+科技+军事的多线程并行、以及"看到画面—决策—执行"之间不能断的回路。宝玉帖里的判断很准:这些模型已经理解建造、采矿、进攻的概念,输给的是执行节奏——知道所有道理,但两条线同时转就宕机。

第三本账:为什么两条线会在同一周一起刷屏——吵的其实是同一个"公不公平"。

9月26日,B站UP主"喵了个猫了个咪了个猫"做了"9个大模型玩游戏,谁最强?ai算法对抗赛第一期",一天播放8.4万、评论465条,热评第一(269赞)说的不是谁的模型聪明,而是变量:“外国模型用专武,glm和dsv4.1不用自家agent,mimo反而用zcode?真想控制变量怎么不用opencode?”。 这跟星际1评论区"调接口不公平"的质疑完全同构——一边在问"AI的腿是不是装了外挂",一边在问"模型的腿是不是没给够"。而混线误读也真实存在:宝玉原帖下就有人留言"前几天刚看了几个AI和韩国一线选手打的视频,职业选手都输了",用第一本账的结论给第二本账抬轿。 所以下次看到"AI vs 人类玩家",先问三件事:这是脚本/特化程序还是通用大模型;它是调接口还是看屏幕;对战环境统一了没有。三问齐了,再决定震惊还是划走。哔哩哔哩微博

第四本账:三类人分开算。

看赛党:智商250aaa的系列还在更新(9/27"400人口对轰"只是中场),番数补齐、APM上限调整后的新对局都值得追;9月19日韩国前职业Paralyze挑战"3000APM"星际AI的视频画面已放出,但胜负结果来源未提及,出结果那期大概率又是一场论战。哔哩哔哩

技术党:这周最大的实用信息是"AI的缺陷清单"——特化程序输在地形利用和大局观(UP自己的简介承认),大模型输在节奏和多线,这正是人打机器的作战地图:拉地形、卡Timing、多线骚扰。红警区早就验证过这套娱乐性——"红警合作战役曼哈顿行动,4人合作打超智能AI,被AI无限操作"一条视频17.4万播放;微博上"现在RTS的电脑真凶几个打的还行的人合作,还能打得过4V4,只要带一个菜鸟,歇菜"也被顶了220个赞。 高强度AI从来不是劝退点,它本身就是内容。下面这帧"科技摆满一桌、还是被枪兵打穿"的Fable对局图,就是人类战术可以照着抄的教科书:微博

星际圈这周自己打起来了:一边APM5000碾压职业,一边19个大模型输给新手——看赛党、技术党、模型党,先把三种AI分开再对账

模型党:测试的代码和对战平台已经开放——“任何人都可以带自己的智能体上去打一局,地址是 bw.swerdlow.dev”。 官网标语就一句:“Give an AI agent the strategy. Watch it play Brood War.”。 但开打前先定口径:要"带手脚"(直接调接口)还是"从零长手"(看屏幕发指令),两者成绩没有可比性——上面两本账已经演示了混淆的代价。微博Brood War Bench官网

值得继续盯的信号:特化AI那条线,简介里说"重置版"(应为重制版)据说快上线,落地与否直接决定"AI碾压职业"内容的下一波;Brood War Bench目前只有模型互打,什么时候开人打机位、榜单会不会被下一档推理模型洗,看官网站更新;大模型对抗赛那期视频简介写着"点赞到500更新下一期",如果UP真按热评要求统一环境变量,那才是干净的分层成绩单。哔哩哔哩

最后一句话存档:这两周刷屏的两条线合起来其实只证明了一件事——碾压职业的机器并不聪明,聪明的机器还没学会出兵的资格。RTS人类玩家最后的阵地,从来不是APM,而是同时转经济、科技、地形、Timing的那几十秒连续判断。这台"多线程",目前的AI连新手村都没出来。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章