大模型一句话能写五子棋,自己坐下下却翻车:今夏最火"AI压力测试"为什么是五子棋

源自9位全网作者

15:19

这几天,感觉半个互联网都在让大模型下五子棋

微博上有人让两个豆包互下五子棋,下到最后一堆棋子挤成一团,“到最后似乎变成球球大作战了”,评论区笑倒一片。微博B站这边更热闹,豆包跟千问对下、DeepSeek 自己跟自己下,还有UP主拍到了豆包"五子棋和围棋混着下"的名场面。哔哩哔哩知乎上有人认真提问"有什么大模型可以跟我下五子棋玩吗",高赞回答直接把天聊死:“跟豆包下,简直就是弱智”。知乎自己上手试过的话,你大概率也见过同类场面:它宣称自己走出活三,可棋盘上连三颗连子都没有;它往已经有棋子的交叉点上落子;它下了三轮就忘记整盘棋,要求重新开始;它赢了认输,输了道喜,抽象得不行。

更抽象的是反差。同样一个大模型,你让它"实现一个网页版五子棋游戏",它分分钟给你交付:棋盘、轮流落子、胜负判定、悔棋一应俱全,做得讲究的还带人机对战和难度选择。有人用同一句提示词测了六个最新模型,全部完成了"能玩的五子棋"这个基本盘。知乎专栏

大模型一句话能写五子棋,自己坐下下却翻车:今夏最火

大模型一句话能写五子棋,自己坐下下却翻车:今夏最火

写代码是默写题,下棋是计算题

为什么差距这么大?打个比方:大模型像一个背熟了天下所有棋谱讲义的人,讲开局理论头头是道,甚至能默写整篇《如何编写五子棋程序》,但它从没真正坐上过棋桌。

聊天大模型的本质是"预测下一个token":它输出的招法是按概率吐出的文本,脑子里并不存在一个可以逐手更新的真实棋盘状态,更没有"我堵这里、他会冲那里"的推演计算。写代码是知识复现,训练数据里五子棋教程代码海量存在;下棋是状态维护加深度计算,恰恰是聊天模型最露怯的地方。所以两个豆包互下才会变成球球大作战——两边都在"说"棋,没有一方真的在看棋盘。

真正的五子棋AI,早就离开聊天框了

事实上,五子棋恰恰是最早被计算机"破解"的游戏之一。上世纪90年代研究者就用计算机搜索证明了无禁手五子棋先手必胜,竞技五子棋也正是为此才层层叠上禁手、交换这类规则去平衡先手优势,swap2(无禁手二次交换规则)已经是常见的比赛规则。知乎弈心、黑石这类老牌五子棋引擎在棋友圈流传多年,算力上根本不是聊天大模型能仰望的:专用引擎几秒就能算出几十手后的必胜路线,如今的高手也都在用引擎拆开局、复盘。所以"AI下五子棋"其实是两个完全不同的世界:一个是用嘴下棋的大模型,上限极低;一个是算棋盘状态的专用引擎,早已超越人类顶尖。这轮大模型热潮,只是把前者推到了大家面前。

大模型一句话能写五子棋,自己坐下下却翻车:今夏最火

想认真下,入口在这里

只想图一乐,就继续跟大模型玩,看它胡说八道本身就是种乐趣;但别把它的招法当教程,也别跟它学阵法。顺带提醒一句:短视频里"红枣阵"这类必胜阵法,只对不会防守的对手有效,遇到会堵的人当场破产,在引擎面前更是笑话。真想涨棋,还是活三、冲四、双三这些威胁顺序的基本功。

想正经跟AI下几盘,路径很短:随便玩玩,微信小程序、网页在线五子棋点开就下;想体验禁手这类专业规则,五林五子棋和弈客五子棋是社区里常被推荐的在线对弈平台。知乎想感受真正强的AI,去找弈心、黑石这类老牌引擎,年纪不小,实力至今在线。

再避个坑:应用商店里不少免费五子棋APP广告和充值套路扎堆,社区里"打开应用商店全是带广告、要充值的垃圾APP"的吐槽由来已久。知乎消磨时间,网页版和小程序反而更清爽。

大模型还没学会下棋,人类还在认真下

就在大模型因为下不好五子棋被全网围观的同时,人类的五子棋顶层照样热闹:8月初刚结束的世界五子棋青少年杯赛上,山东临沂的潘冠臣临危稳住局势成功卫冕,这届比赛采用线上对弈、全程视频监控的模式。知乎

五子棋的故事,比大模型胡说八道的棋局有意思多了。下次再看到有人让大模型下五子棋,你可以在评论区留下一句:不是大模型笨,是它下的从来就不是五子棋。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章