谷歌DeepMind推出的数学研究智能体Aletheia,在FirstProof挑战中自主解决了6道高难度研究级数学题。这一成果超越了去年AI获得IMO金牌的分量,标志着AI已从解题进阶到参与真实数学研究,为科研协作模式带来新变革。
智能速览
DeepMind的Aletheia在FirstProof挑战赛中解决6道研究级难题。
评估标准接近论文审稿,题目来自真实科研过程且从未公开。
Aletheia具备自我筛选机制,无解时会主动输出未找到结果。
解决问题的推理成本较高,部分题目高出以往一个数量级。
未来数学研究或将形成人类定方向、AI做验证的协作模式。
精华内容
AI数学研究能力的跃升不仅体现在竞赛金牌,更在于能否攻克真实的科研难题。
真实科研挑战
FirstProof并非常规的数学竞赛,而是专门为评估AI数学研究能力设计的实验性挑战。其题目全部源自一线研究者在真实科研过程中的未解命题,且在挑战前从未公开证明,标准证明经加密保存以杜绝数据泄露。最终答案需由领域专家人工审阅,评判逻辑严密性,标准接近学术论文审稿而非简单的自动判分,这测试的是AI在陌生问题上的长期推理能力。
超越IMO金牌
由Gemini 3 Deep Think驱动的Aletheia智能体,在无人工干预下自主运行,最终解决了10道难题中的6道。DeepMind超人类推理负责人认为,这一成果的分量超过了AI在IMO竞赛中获得金牌的表现。此前IMO金牌标志着解题能力的巅峰,而攻克FirstProof则意味着AI已具备参与复杂数学研究的潜力,能够处理连顶尖数学家都感到棘手的问题。
自我筛选机制
Aletheia展现了独特的可靠性设计,即“自我筛选”机制。面对无法解决的问题,该智能体会明确输出“未找到解答”或超时未返回,而非产生错误的幻觉答案。在评估中,两个版本虽然各自出现过假阳性,但通过互补机制提供了可信解答。这种设计极大地节省了人类专家验证错误结果的时间,解决了AI作为研究助手的首要瓶颈。
推理与成本
虽然Aletheia在准确率上较以往版本有明显提升,但推理成本也随之增加。数据显示,解决FirstProof问题的计算消耗普遍高于此前解决Erdős问题,其中第7题的推理成本更是高出一个数量级。这主要源于生成候选解的资源消耗以及通过验证子智能体所需的多轮交互,表明高质量的研究级证明需要付出更高的算力代价。
未来科研模式
当前AI已开始在数学的证明与验证环节发挥作用,虽然还无法全面承担提出问题和建立框架的工作,但未来的协作模式正在成型。人类研究者负责提出核心思想与方向,AI则负责高强度的路径搜索与形式化验证,最后由人类进行理论整合。这种模式将重塑数学研究的流程,甚至引发对AI在论文作者署名中身份的思考。
Aletheia在FirstProof挑战中的成功,证明了AI正从单纯的解题工具转变为数学研究的参与者。这种“人机协作”的新范式将大幅提升科研效率,拓展人类认知的边界。随着AI在推理能力上的持续进化,未来数学领域或许将迎来全新的突破。