最近这段时间,数独圈在集体"拷打"大模型。
B站有主播直播挑战数独失败,转头喊AI帮忙解题,切片标题直接写"给元宝干’破防’、给豆包干循环死机"(切片自己标注了标题纯属娱乐,但AI在现场反复卡壳是真的)。哔哩哔哩知乎上,“为何ai解不出数独?”“数独,哪位大神解释一下逻辑。问过豆包了,它在胡说?“这类提问也隔三差五冒出来。知乎还有玩家把卡住的题直接贴给DeepSeek和智谱清言,得到的反馈是"他们也撑爆了内存,没给个答案,一个给了个思路”。知乎甚至有人只是想让AI帮忙判断"这道题是不是出错了”,得到的回复也是一本正经的胡说,最后只能发帖感叹"AI已疯"。
这事反常识的地方在于:一个能写合同、能写代码、能通过各种考试的AI,会在9×9=81个格子上栽跟头。今天把这件事说清楚——它为什么解不动,更重要的是,玩数独时它到底能帮你干什么。
一、不是AI笨,是"工种不对口"
数独本质上不是一道"题",而是一个约束满足问题:你每填一个数,其余80个格子的候选情况都会跟着变,需要不断"假设—检验—回退"。人类解数独靠的是草稿纸:标候选数、做记号、划掉重来,这相当于把记忆和搜索过程外包给了纸面。

大模型的工作方式正好相反。它是一个字一个字往外生成的(自回归生成),输出是一条单行道,没有倒挡。它填某个格子时,依据的是"这段话后面接哪个数字最顺",而不是"这个数放进整盘棋还成不成立"。
知乎上一位开发者的总结很到位:让大模型直接解数独,相当于把一棵搜索树强行展开成一段顺序文本,必然带来两个问题——上下文爆炸和注意力漂移。知乎填的数越多,它越容易"忘记"前面的约束;一旦某个数填错,后面整条线都会顺着错下去,而且它不会说"我错了,重来",只会继续流畅地编。
哪种题最容易让它翻车?越难越翻。简单题它或许能"蒙"对——注意这个"蒙"字,因为那很可能是模式匹配甚至背题:训练数据里见过的名题,被它原样背了出来。你换几个已知数,它的真实水平立刻现形。这也解释了为什么它有时"解对了"、有时满嘴跑火车:不是它状态起伏,是这道题它"见过"还是"没见过"的区别。
这不是网友们的段子式结论,已经有人把它做成了严肃的测试。今年8月,知乎上有用户详细介绍了专门考察大模型解数独等纸笔谜题能力的评测基准Pencil Puzzle Bench(arXiv:2603.02119),51个模型参加测试:最强的推理模型,不借助代码和算法、纯靠推理去解普通数独,成功率只有33.3%;给它加上"边做边检查"的能力后,成功率升到56.0%——有进步,但离可靠还差得远。知乎基准作者还点出了更根本的原因:数独这类问题已被证明是NP完全的,意味着"表面模式匹配"不可能通吃所有变种和尺寸,推理深度是刚需。
下面的对比图来自这套评测:几乎所有模型"直接答题"的成绩,都明显低于进入"能边做边查"的智能体模式之后——这也印证了前面的判断:问题不在智力,在于有没有给它草稿纸。

二、反转来了:换个说法,同一个AI秒解数独
把提示词从"帮我解这道题"改成"帮我写一个程序解这道题",场面立刻反转。解数独是计算机科学里的经典编程题:回溯法,十几行代码,让程序逐格试数、冲突就退回,任何一道标准数独都能在毫秒级解完,答案保证正确。而写这种程序,恰恰是现在主流大模型最不容易翻车的活儿。

所以结论不是"AI不会数独",而是:它擅长把任务翻译成可执行的方案,不擅长亲自下场做精确计算和全局校验。你直接甩题目给它,是在让一个"方案型选手"去干"计算型工人"的活。
三、用法对照表:三种错误用法,三种正确用法
先说三种建议别干的:
第一,直接贴题要答案。难度越高翻车率越高,而且就算给出答案,你也无法确认它的推理过程是否成立——而数独的乐趣恰恰全在过程里,抄一个来路不明的答案,等于白玩。
第二,让它判断"这道题是不是出错了、是不是多解"。这是大模型最不靠谱的用法之一,它倾向于给你一个顺耳的"没问题"。题目校验是纯机械活,交给求解程序做,是满分答案。
第三,全信它给你的逐步推理。它输出的推理链条读起来通顺,恰恰是最强的伪装——错误的链也能编得头头是道。
再说三种可以放心用的:
第一,当技巧教练。数独圈对高级技巧的需求是真实存在的:B站一个"掌握这些技巧你就能解99%的难题"的教程视频能拿到1500多个收藏。哔哩哔哩知乎也常年有人问"数独XYZ-Wing中,为什么r1c1≠5的判断是错误的?"这类具体问题。知乎卡在这个门槛上的人,可以让AI先把X-Wing、XY-Wing、链这些概念讲明白,再用一道真实题目对照验证——概念讲解大多靠谱,具体推演必须复核。

第二,让它写代码解题、验题。解一道题、数一数有几个解、校验题目是否合法,一句话的事,几秒钟跑完,比任何模型的嘴都可靠。
第三,生成练习题和变体规则。杀手数独、对角线数独、不等号数独……可以让它按你指定的难度出题,或者把某个变体的规则翻译、解释给你听。但记得补最后一步:用程序校验生成的题有唯一解,再上手玩。
四、不同段位,给一句不同的建议
还在排除法、唯一余数阶段的入门玩家:别让AI直接给答案,让它"每次只给一步提示"。直接要答案的坑不只是答案可能错,更在于它会毁掉这个游戏唯一的多巴胺来源。
卡在难题上、想学高级技巧的进阶玩家:组合拳最划算——AI讲概念、真实题目对照、再用主流数独App的候选数功能当草稿纸。候选数功能本身就是最好的"外挂记忆",这一步不需要AI。
变体玩家和高手:让AI给你写求解器、生成题目,你从做题的人变成出题的人。海外变体数独社区(sudokupad、logic-masters这类平台)早就是这种玩法,B站上每周更新的变体数独实况系列,背后基本就是这个生态。
最后说句跟钱包有关的:以上所有用法,用主流大模型的免费额度就能完成,求解器、在线数独平台也都有免费方案,没必要为"AI教数独"额外付费。最近数独的青少年课程和资料包多了起来,家长想掏钱之前,不妨先让孩子用"免费App+AI当教练"这套组合练一个月,再判断要不要报课。
留一个观察信号:推理模型进化很快,也许哪天就有模型能不借助代码直接硬解高难度数独。真到那天,这篇避坑指南就过时了——那本身也挺值得围观。在那之前,分工明确一点:代码让AI写,推理的乐趣你自己留着。