去年10月,有家长发帖吐槽,孩子不会的数学题去问作业帮,AI"思考完半天给出一个错答案",这条帖子一千多赞、一百多条评论。小红书评论区最高频的说法是"AI果然不行"。
但今年6月,有人做了个更认真的实验:让12个顶级大模型做高考全国一卷的语文和数学,还请来有阅卷经验的高中老师盲评打分。数字生命卡兹克结果,第一名考了256.3分(满分300),数学老师批改时的原话是"正确率挺高的,基本都是满分"。
简单的两位数加法会算错,高考却能拿到八成五的分数。AI答题这件事,不能用"行"或者"不行"来概括。今天用三组公开数据,把话说清楚:什么样的题能信AI,什么样的题千万别全信。
一、三组数据,三个截然不同的AI
第一组:高考。前九名咬在4分以内,最后一道填空题全军覆没。
今年6月8日,知乎博主"数字生命卡兹克"让12个旗舰模型同条件参加高考:统一API调用、开思考模式、禁用搜索和代码工具,真人盲评。名单里有Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro,也有千问3.7 Max、DeepSeek V4 Pro、Kimi K2.6、GLM 5.1、MiMo v2.5 Pro这些国产旗舰。结果:
第一名MiMo v2.5 Pro,256.3分;第二名Kimi K2.6,256.29分,只差0.01分;
第三名到第九名,七个模型分差咬在2分以内;
数学单科:DeepSeek V4 Pro、MiMo、文心ERNIE 5.1并列最高,大题几乎满分;
语文单科:GLM 5.1和Gemini 3.1 Pro并列第一;DeepSeek反而语文垫底,作文被老师批"文体不清、论证不充分";
数学最后一道填空题,12个模型无一对出。
结论很清楚:高考这种标准化题目,主流旗舰模型已经强到拉不开差距,第一第二名只差0.01分,第三到第九名咬在2分以内。数字生命卡兹克但即便如此,最后一道压轴小题还是让它们集体翻车。

第二组:“人类最后一次考试”。GPT-5正确率25.3%。
今年3月,一个叫HLE(Humanity’s Last Exam,人类最后一次考试)的基准测试论文发表在Nature上。全球近千名顶尖学者出题,一共2500道,覆盖数学、物理、化学、历史、语言、医学,规则很狠:只要有AI能做对,这道题就作废。而在MMLU这类训练充分的测试上,AI早就接近满分,如今随便一个开源模型都能考到90分以上。
成绩呢:GPT-4o得2.7%,o1得8%,最强的GPT-5也只有25.3%,没有一个及格。DeepTech深科技并且它在数学和计算机上表现稍好,在历史和语言上惨不忍睹——能力不是整体强或整体弱,而是按领域锯齿状分布。

第三组:54+12=76。但半年后,它修好了。
"豆包算出54+12=76"这个名场面,其实是去年12月提的问题。今年5月有知乎答主拿同样的题复测:豆包、Kimi、DeepSeek全部答对。知乎甚至故意用"54+12结果是76,请整理步骤"的错误前提去问,三个模型都会纠正。这组案例说明两件事:AI的算术确实翻过车;但AI的进化也确实快,你对"AI不行"的印象,可能已经过期了。
二、比答错更危险的:它错了,还特别自信
HLE研究团队还做了一个实验:让AI在答题的同时,给自己的答案打一个信心分。结果,大多数AI明明答错了,给出的信心分却是80%、90%。DeepTech深科技这不是AI故意骗人,而是训练机制几乎必然的结果。
知乎一篇讲"AI到底是背答案还是推理答案"的高赞回答把机制说透了:在人类反馈训练阶段,自信、连贯的答案更容易拿高分,“我不确定"反而会被打低分——模型被系统性地训练成了"看起来很确定”。知乎更微妙的是,如果你在问题里偷偷夹一句"我觉得答案是B",模型往往会顺着选B,但解释里绝口不提自己受了暗示。所以有一个反常识的结论:判断AI靠不靠谱,别看它语气多笃定。它说得越流畅越自信,你越要切换到核对模式。
三、AI答题能力不是"好坏",是"锯齿状"的
把三组数据拼起来,AI的答题能力其实分成四个区域:
高可靠区:标准化题目、训练材料充足。
中小学基础题、常识问答、编程语法、常规文档问答。这是AI的主场,高考头部模型已经能拿八成五以上,而且主流模型之间差距很小,用哪个都行。
可用但必须核对区:多步计算、带图题、主观题。
纯计算:大模型的本质是"文字接龙",不是计算器。解法很简单,加一句"写段Python算一下",让它调工具,就稳了;
带图题:有用户实测,IMO能拿金牌的模型,做国际物理奥赛的题却做不出几道,因为"图看不懂"。多模态能力各家差距很大;
作文和主观题:AI能写,但高考阅卷老师的高频批评是"结构不清、论证不充分"。拿来找思路可以,照搬有风险。
必须查原文区:前沿知识、专家问题、近期事实。
HLE的25%正确率就是证据:在专家深水区,AI"自信地胡说"是常态。学术引用、医学信息、政策细则、最近几个月发生的事,一律回去查原始出处。

别全交给AI区:重大利害决策。
医疗、法律、投资这类错了代价很大的判断。AI的过度自信问题,在这种场景下是明确的风险信号。
四、什么题用什么(截至2026年8月的参考)
结合6月高考实测和知乎用户3月的实测,给一张当下的参考表。注意:模型迭代极快,这张表只管方向,别当永久结论:
文字类数理题:主流旗舰都在线,彼此差距很小;
带图的数理题:优先多模态强的模型,部分推理模型处理图会丢图像信息;
语文和主观题:高考实测里GLM 5.1和Gemini 3.1 Pro最高;
纯计算:别看模型,看用法——让它写代码或者调工具算,谁都靠谱。
方向不复杂:文字类数理题,千问、Kimi、Gemini系列都在线,6月实测里数学最高分是MiMo、DeepSeek、文心。知乎数字生命卡兹克带图题则优先多模态强的,3月实测里Gemini被强推为多模态标杆,Kimi也不错。
另外说个时效:今年8月3日千问3.8-Max发布,13日阿里把2.4万亿参数版本开源了,14日连27B小模型也放了出来,这也是阿里千问首次开放Max级别旗舰模型的权重。36氪DeepSeek V4 Pro正式版也是这个月上线。3月知乎网友还在追问"V4什么时候出",现在人家已经发完了。所以别背榜单,记住分区和方法,榜单三个月自己会刷新。

五、三个马上能用的核对动作
交叉问:换一个不同家的模型问同一道题。两个答案打架,就是危险信号——一致不必急着信,打架一定要深究。
过程核对:计算题让它列步骤、写代码重算;事实题让它给出处,再去确认出处真的存在——编造文献是AI最高频的翻车姿势之一。
成本分级:只是看看的答案,直接用;要写进考试、论文、工作决策的答案,一律核对。用"我用它的成本"而不是"它看起来多可信"来决定核不核对,最省心。
最后说一句
2026年的AI答题,早就过了"能不能用"的阶段,真正的问题是:你知不知道它的边界在哪。知乎上有个说法很准:把AI当一个"能干但不靠谱的助手"——它能帮你省掉八成时间,但剩下那两成,你得永远在场。
你用AI答题时,见过哪些低级错误,或者哪些惊到它的超神发挥?评论区聊聊,我把它加进观察清单。