张大妈

谷歌给「AI解数学题」神话降温:能摘低垂果实,但过程依然痛苦

源自今日头条:新浪财经

02-05 14:02

谷歌最新研究揭示了AI解数学题的真实水平:Gemini在700个未解猜想中推进13个,但背后成本远超想象。这项研究不仅展示了AI摘取低垂果实的可能性,更暴露了当前AI数学研究的根本局限。

谷歌给「AI解数学题」神话降温:能摘低垂果实,但过程依然痛苦智能速览

  • Gemini在Erdős数据库700个未解问题中推进13个

  • 其中5个是AI自主给出的全新解法

  • 68.5%的候选解存在根本性错误

  • 多数困难不在数学推导而在题面歧义

  • AI存在潜意识抄袭文献的风险

谷歌给「AI解数学题」神话降温:能摘低垂果实,但过程依然痛苦精华内容

当AI宣称攻克数学难题时,我们看到的往往只是冰山一角。谷歌这次的研究,首次完整揭开了AI数学发现背后的真实成本。

筛选过程

研究团队部署了定制数学研究智能体Aletheia,首先通过自然语言验证器将700个问题快速收敛到212个候选解。这个初始过滤阶段就筛掉了近70%的内容。

接下来进入人工评估阶段,非专业数学家先进行快速过滤,将候选压缩到27个,最后由领域专家逐一严审。这种多层筛选机制确保了结果的可靠性。

错误分析

数据显示,在可明确判定的约200个候选解中,137个(68.5%)存在根本性错误。63个在形式上成立,但只有13个(6.5%)真正回答了Erdős原本想问的问题。

其余50个虽然技术上正确,却因为误读题意而导致数学意义有限。这种高错误率暴露了当前AI在理解数学问题本质上的缺陷。

解法分类

13个有意义的正确结果被分为四类:AI自主解决(2个)、部分由AI解决(3个)、独立重发现(3个)和文献识别(5个)。

值得注意的是,5个自主解决方案均未达到学术论文水平,其中一些仅相当于研究生习题难度。这说明AI目前只能解决相对简单的数学问题。

核心挑战

研究发现,许多问题的困难不在数学推导,而在题面细节的抄录误差、遗漏以及符号定义的歧义。模型若不了解特定领域的定义惯例,往往会在多个看似合理的解释之间混淆。

另一个挑战是确认解答是否已在文献中出现,这一步需要耗费大量专家时间进行文献核查。

抄袭风险

研究揭示了一个新问题:AI可能会再现预训练过程中习得的文献知识,却不注明来源,即存在潜意识抄袭的风险。虽然作者检查了推理过程日志,但仍无法完全排除间接获取的可能性。

这种风险随着AI生成数学内容的增多而变得更加严峻,学术界需要建立新的规范来应对。

这项研究既展示了AI在数学领域的潜力,也清醒地指出了当前技术的局限性。如果能够提高可靠性,AI确实有望加速数学发现,但距离真正的自主研究还有很长的路要走。未来,如何平衡AI的效率与学术的严谨性,将是一个值得持续探索的课题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章