大模型已经开始在高考数学上集体拿高分了
大模型已经开始在高考数学上集体拿高分了:满分 150 分,GPT-5.5、DeepSeek_v4直接拿到144,Gemini 和 Opus4.8 都是142。再往后看,Kimi2.6、Unisound U2、GLM5.1、豆包等国产模型,也基本集中在 130~139 分这个区间。

说实话,这个分数已经不是“会做题”的程度了。高考数学考的不只是计算能力,更考验审题、条件理解、公式选择、多步骤推理和解题稳定性。尤其是大题,只要中间一步走偏,后面基本就全乱了。所以这张成绩单让我最有感触的地方,是它正在把“复杂推理”这件事做得越来越稳定。
当然, 真实世界的问题不会像试卷一样条件明确,也不一定有标准答案。但这张成绩单至少提供了一个很直观的观察窗口:大模型的底层推理能力,已经比很多人想象中更扎实了。
以前我们问 AI:“你懂不懂?”
现在可能要开始问:“你能不能持续做对?”
#AI大模型 #高考数学 #国产大模型 #大模型评测 #人工智能 #AI推理 #高考回忆杀

校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案
校验提示文案