8月中旬,B站一条《豆包跟千问下五子棋》悄悄过了8万播放:两个聊天AI一黑一白互相落子,千问在必输局面下"奇迹般"赢下,高赞评论(713赞)损它是"史之一手转胜为败"。哔哩哔哩
随后两周,"让AI下五子棋"成了2026年门槛最低的民间测试:B站上元宝vs豆包、豆包和豆包自己下的对局接连上线,还有人让Codex自对弈。有粉丝拍的偶像选手和AI下棋"全程疑惑脸"视频,在微博收获1600多赞。微博连"会下五子棋的边牧"都靠这个梗刷屏,知乎上干脆有人直接发帖发问——有没有大模型能陪自己正经下一局五子棋。知乎
为什么全网用五子棋测大模型,而不是象棋围棋?答案很实在:15×15的棋盘、一眼能看懂的胜负规则,全程能用纯文字说清楚——不需要装任何工具,聊天框就是棋盘。这让它成了最便宜的AI能力探针,也让它暴露的短板格外真实。

翻车不是演的:两组5局实测和一句大实话
知乎开发者cwm22做了个开源小系统:把五子棋规则写进提示词,两个大模型轮流对话,每轮只告诉它对手落子的位置,它回一行"7,7"这样的坐标,落错点直接判负。他让deepseek-v4-pro自己跟自己下了5局,有2局走出了非法着法——下的那个点,自己的棋子早就占着了;换成mimo-v2.5-pro,非法位置更多。知乎他特意强调:每局的上下文远没到模型的上限,问题不是"看不见",是"记不住"。
最离谱的一类错误是,模型在文字里推理得分毫不差——“黑棋在第7列已连成三子,必须立刻封堵”——然后一手指向自己此前已经下过的那个点。他的结论毫不客气:LLM下五子棋基本是婴儿级水平,而且思考慢、耗时还长。知乎
视频区里点赞最高的一条评论,则替所有人说破了原理:现在的聊天AI根本没有棋盘,只有语言上下文,不重新"喂"局面它就记不起之前下了啥。哔哩哔哩至于视频里那些"神之一手",很多是截图式一问一答加剪辑效果——当乐子看没问题,把它当AI能力的证据就上当了。
但另一面:AI下不好棋,写的棋比你会下
8月同样刷屏的,还有另一种玩法:对coding大模型说一句"实现一个网页版五子棋游戏"。科技作者鸟窝用同一句提示词测了当时6个最新模型,结果分化明显:Opus 5最有工程味,拆成多文件、自带alpha-beta人机AI、补了单元测试和键盘操作,代价是不能双击直开;gpt-5.6-sol最像成品,人机对战、计时、规则说明全给你配齐;deepseek-v4-pro最省事,一个22KB的单文件双击就能玩,但只做了双人对战,没有AI;MiniMax-M3界面最精致、连启发式评分的攻防权重都写得很细——结果人机对战是坏的;glm-5.2是唯一交付前"自己给自己验收"的,跑完语法检查、无头浏览器截图确认渲染才交活;gpt-5.6-luna则把技能点全点在美术上,杂志级排版,但没有AI。知乎
鸟窝的结论值得截图:模型自述的功能清单不能全信,得亲自跑一遍——看着最强的小马,恰恰核心玩法跑不通。知乎

这就构成了今年最有意思的一个反差:模型亲手写出来的alpha-beta五子棋程序,认真实现的话,比它自己下棋强到不知道哪里去。这并不意外——无禁手五子棋在90年代中期就被学术界证明先手必胜,用精确搜索的专用程序早就打到普通人十年练不出来的高度。下棋是"维护状态机"的问题,恰好是语言模型的短板;写五子棋是"语言加代码"的问题,恰好是它的长板。"会写不会下"不是段子,是一场五子棋给大模型能力边界画的地图。
普通用户怎么不白玩:三条路线对号入座
就想跟AI下一盘、还不想看它鬼畜:别指望它记住棋盘,每一轮把完整棋盘文字加对手最新一手重新发给它,并限定"只输出坐标,不要解释"——上面那位开发者的系统提示词思路可以直接抄。做到这一步,多数主流模型能正常下完一局,但别指望棋力。
想要一个真正赢不了你的对手:用专用五子棋软件,或者干脆让coding模型写一个"带人机对战"的网页五子棋,自己跑通再玩——程序里那个AI会老老实实计算,输给你的概率比聊天模型"失忆"的概率低得多。
想借这个话题检验一下各家大模型:同一句"实现一个网页版五子棋游戏",跑一遍看谁补全需求、谁有工程严谨度、谁在PPT式报功能,比背榜单便宜也真实得多。

适合谁、跳过谁:天天用豆包、DeepSeek、元宝办事的人,这篇帮你校准"它到底懂不懂眼前这盘棋"的预期;只想周末跟孩子下两盘的,小程序五子棋就够了,没必要为"AI对弈"额外付费;家长也别把孩子棋力进步的预算押在聊天大模型上——练棋请找专用工具。
最后留一个继续观察的信号:这是少见的零门槛、全网可复现的AI测评。哪天你发现某个模型在纯聊天里连下二十手都不再记错盘面,那个时刻比任何跑分榜都更值得记录——说明它真的开始维护一个内部世界模型了。