谷歌DeepMind推出的数学研究智能体Aletheia,正在改变科研的游戏规则。它不仅能在顶级基准测试中超越GPT-5.2等模型,更独立解决了数学难题并撰写论文,标志着AI从工具进化为科研合伙人。

智能速览
Aletheia在IMO-ProofBench基准测试中取得91.9%的SOTA成绩。
它以更低算力实现更高推理质量,并能自我纠错。
该智能体独立撰写了高水平数学论文,并破解了数个未解之谜。
除了数学,它在物理、计算机科学等领域也取得关键突破。
谷歌为AI辅助研究建立了4级分类体系,其成果已达可发表级别。
精华内容
这款名为Aletheia的智能体究竟如何做到?其背后是技术、方法论与科研模式的深度融合。
性能碾压
Aletheia 在 IMO-ProofBench 上得分 91.9%,刷新了 SOTA(最先进技术水平)。这个成绩显著优于 GPT-5.2 和 Claude 等竞争对手。
一个关键优势是其效率:它用更少的算力实现了更高的推理质量。此外,它具备自我纠错能力,会主动承认无法解决的问题,这直接解决了困扰 AI 的“幻觉”问题,使其输出更加可靠。
实战成果
在理论测试之外,Aletheia 的实战表现同样惊人。它已经完成了 6 篇高水平的数学论文,其中一篇实现了零人工干预的独立撰写。
它还对 Erdős 猜想数据库中 700 个开放问题进行了系统性评估,并独立解决了其中 4 个长期悬而未决的难题。根据谷歌为 AI 辅助研究设立的 4 级分类标准,Aletheia 的多项成果已达到 2 级,即可发表的质量,并已投稿至知名期刊。
跨界探索
Aletheia 的能力远不止于数学。作为 Gemini Deep Think 的一部分,它展示了强大的跨学科研究能力。它帮助专家终结了在线子模优化领域长达十年的猜想,打破了最大割、施泰纳树等经典离散算法的瓶颈。
在理论物理领域,它为宇宙弦物理学带来了新见解,甚至在 AI 时代经济理论方面也取得了突破。相关研究论文已被顶级会议 ICLR 2026 接收,证明了其学术价值。
从解决奥数题到投身博士级科研,AI 正在成为人类智慧的“倍增器”。Aletheia 的出现预示着一个科研新范式,人与 AI 的协作将如何加速科学探索的未来?