一项针对Deepseek模型的实测显示,其能够全部答对2026年麻省理工积分竞赛决赛题,展现了AI在复杂逻辑推理领域的新突破。尽管部分题目耗时超出时限,但其100%的准确率依然值得关注。
智能速览
Deepseek在麻省理工积分决赛题上取得100%准确率。
模型成功解答全部五道高难度积分题。
因两道题解答超时,最终得分3/5。
实测结果反映了近期更新带来的性能提升。
精华内容
为了验证其真实水平,一场针对顶级数学难题的实测悄然展开,结果令人瞩目。
严苛测试规则
本次实验模拟了2026年麻省理工积分大赛决赛的严苛环境。比赛规则要求每道题在5分钟内完成,且只评判最终答案的正确性,接受代数等价的答案。测试中的Deepseek模型使用统一的“计算 {题目}”作为提示词,开启了思考模式但关闭了联网搜索,以确保其独立推理能力。
解题结果速览
在五道决赛题中,Deepseek的答案准确率达到了惊人的100%。具体耗时分别为:第一题89秒,第二题620秒,第三题210秒,第四题69秒,第五题935秒。然而,由于第二题和第五题的解答时间超过了300秒的限时,按照规则,最终得分被判定为3/5。
性能提升洞察
这次出色的表现,特别是对复杂问题的全盘掌握,被认为与Deepseek近期的一次更新密切相关。更新后,模型在处理长上下文和复杂逻辑链方面的能力有了明显提升。虽然速度仍有优化空间,但能够完全正确解答这类级别的数学难题,本身就标志着AI推理能力迈上了一个新台阶。
这次实测不仅是Deepseek技术实力的证明,也让人看到AI在专业领域应用的巨大潜力。当推理准确性不再是瓶颈,下一个挑战会是什么?