AI高考能考256分,专家题正确率却只有25%:AI答题到底哪句能信?

源自7位全网作者

08:11

去年10月,有家长发帖吐槽,孩子不会的数学题去问作业帮,AI"思考完半天给出一个错答案",这条帖子一千多赞、一百多条评论。小红书评论区最高频的说法是"AI果然不行"。

但今年6月,有人做了个更认真的实验:让12个顶级大模型做高考全国一卷的语文和数学,还请来有阅卷经验的高中老师盲评打分。数字生命卡兹克结果,第一名考了256.3分(满分300),数学老师批改时的原话是"正确率挺高的,基本都是满分"。

简单的两位数加法会算错,高考却能拿到八成五的分数。AI答题这件事,不能用"行"或者"不行"来概括。今天用三组公开数据,把话说清楚:什么样的题能信AI,什么样的题千万别全信。

一、三组数据,三个截然不同的AI

第一组:高考。前九名咬在4分以内,最后一道填空题全军覆没。

今年6月8日,知乎博主"数字生命卡兹克"让12个旗舰模型同条件参加高考:统一API调用、开思考模式、禁用搜索和代码工具,真人盲评。名单里有Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro,也有千问3.7 Max、DeepSeek V4 Pro、Kimi K2.6、GLM 5.1、MiMo v2.5 Pro这些国产旗舰。结果:

  • 第一名MiMo v2.5 Pro,256.3分;第二名Kimi K2.6,256.29分,只差0.01分;

  • 第三名到第九名,七个模型分差咬在2分以内;

  • 数学单科:DeepSeek V4 Pro、MiMo、文心ERNIE 5.1并列最高,大题几乎满分;

  • 语文单科:GLM 5.1和Gemini 3.1 Pro并列第一;DeepSeek反而语文垫底,作文被老师批"文体不清、论证不充分";

  • 数学最后一道填空题,12个模型无一对出。

结论很清楚:高考这种标准化题目,主流旗舰模型已经强到拉不开差距,第一第二名只差0.01分,第三到第九名咬在2分以内。数字生命卡兹克但即便如此,最后一道压轴小题还是让它们集体翻车。

AI高考能考256分,专家题正确率却只有25%:AI答题到底哪句能信?

第二组:“人类最后一次考试”。GPT-5正确率25.3%。

今年3月,一个叫HLE(Humanity’s Last Exam,人类最后一次考试)的基准测试论文发表在Nature上。全球近千名顶尖学者出题,一共2500道,覆盖数学、物理、化学、历史、语言、医学,规则很狠:只要有AI能做对,这道题就作废。而在MMLU这类训练充分的测试上,AI早就接近满分,如今随便一个开源模型都能考到90分以上。

成绩呢:GPT-4o得2.7%,o1得8%,最强的GPT-5也只有25.3%,没有一个及格。DeepTech深科技并且它在数学和计算机上表现稍好,在历史和语言上惨不忍睹——能力不是整体强或整体弱,而是按领域锯齿状分布。

AI高考能考256分,专家题正确率却只有25%:AI答题到底哪句能信?

第三组:54+12=76。但半年后,它修好了。

"豆包算出54+12=76"这个名场面,其实是去年12月提的问题。今年5月有知乎答主拿同样的题复测:豆包、Kimi、DeepSeek全部答对。知乎甚至故意用"54+12结果是76,请整理步骤"的错误前提去问,三个模型都会纠正。这组案例说明两件事:AI的算术确实翻过车;但AI的进化也确实快,你对"AI不行"的印象,可能已经过期了。

二、比答错更危险的:它错了,还特别自信

HLE研究团队还做了一个实验:让AI在答题的同时,给自己的答案打一个信心分。结果,大多数AI明明答错了,给出的信心分却是80%、90%。DeepTech深科技这不是AI故意骗人,而是训练机制几乎必然的结果。

知乎一篇讲"AI到底是背答案还是推理答案"的高赞回答把机制说透了:在人类反馈训练阶段,自信、连贯的答案更容易拿高分,“我不确定"反而会被打低分——模型被系统性地训练成了"看起来很确定”。知乎更微妙的是,如果你在问题里偷偷夹一句"我觉得答案是B",模型往往会顺着选B,但解释里绝口不提自己受了暗示。所以有一个反常识的结论:判断AI靠不靠谱,别看它语气多笃定。它说得越流畅越自信,你越要切换到核对模式。

三、AI答题能力不是"好坏",是"锯齿状"的

把三组数据拼起来,AI的答题能力其实分成四个区域:

高可靠区:标准化题目、训练材料充足。
中小学基础题、常识问答、编程语法、常规文档问答。这是AI的主场,高考头部模型已经能拿八成五以上,而且主流模型之间差距很小,用哪个都行。

可用但必须核对区:多步计算、带图题、主观题。

  • 纯计算:大模型的本质是"文字接龙",不是计算器。解法很简单,加一句"写段Python算一下",让它调工具,就稳了;

  • 带图题:有用户实测,IMO能拿金牌的模型,做国际物理奥赛的题却做不出几道,因为"图看不懂"。多模态能力各家差距很大;

  • 作文和主观题:AI能写,但高考阅卷老师的高频批评是"结构不清、论证不充分"。拿来找思路可以,照搬有风险。

必须查原文区:前沿知识、专家问题、近期事实。
HLE的25%正确率就是证据:在专家深水区,AI"自信地胡说"是常态。学术引用、医学信息、政策细则、最近几个月发生的事,一律回去查原始出处。

AI高考能考256分,专家题正确率却只有25%:AI答题到底哪句能信?

别全交给AI区:重大利害决策。
医疗、法律、投资这类错了代价很大的判断。AI的过度自信问题,在这种场景下是明确的风险信号。

四、什么题用什么(截至2026年8月的参考)

结合6月高考实测和知乎用户3月的实测,给一张当下的参考表。注意:模型迭代极快,这张表只管方向,别当永久结论:

  • 文字类数理题:主流旗舰都在线,彼此差距很小;

  • 带图的数理题:优先多模态强的模型,部分推理模型处理图会丢图像信息;

  • 语文和主观题:高考实测里GLM 5.1和Gemini 3.1 Pro最高;

  • 纯计算:别看模型,看用法——让它写代码或者调工具算,谁都靠谱。

方向不复杂:文字类数理题,千问、Kimi、Gemini系列都在线,6月实测里数学最高分是MiMo、DeepSeek、文心。知乎数字生命卡兹克带图题则优先多模态强的,3月实测里Gemini被强推为多模态标杆,Kimi也不错。

另外说个时效:今年8月3日千问3.8-Max发布,13日阿里把2.4万亿参数版本开源了,14日连27B小模型也放了出来,这也是阿里千问首次开放Max级别旗舰模型的权重。36氪DeepSeek V4 Pro正式版也是这个月上线。3月知乎网友还在追问"V4什么时候出",现在人家已经发完了。所以别背榜单,记住分区和方法,榜单三个月自己会刷新。

AI高考能考256分,专家题正确率却只有25%:AI答题到底哪句能信?

五、三个马上能用的核对动作

  1. 交叉问:换一个不同家的模型问同一道题。两个答案打架,就是危险信号——一致不必急着信,打架一定要深究。

  2. 过程核对:计算题让它列步骤、写代码重算;事实题让它给出处,再去确认出处真的存在——编造文献是AI最高频的翻车姿势之一。

  3. 成本分级:只是看看的答案,直接用;要写进考试、论文、工作决策的答案,一律核对。用"我用它的成本"而不是"它看起来多可信"来决定核不核对,最省心。

最后说一句

2026年的AI答题,早就过了"能不能用"的阶段,真正的问题是:你知不知道它的边界在哪。知乎上有个说法很准:把AI当一个"能干但不靠谱的助手"——它能帮你省掉八成时间,但剩下那两成,你得永远在场。

你用AI答题时,见过哪些低级错误,或者哪些惊到它的超神发挥?评论区聊聊,我把它加进观察清单。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章