微博热搜 #AI把数学干废了# 说的是数学共同体的前途,而普通家庭更在意的是一个很具体的问题:市面上的数学AI辅导工具到底能不能用。这两件事其实是同一个事件——先看清发生了什么,才知道工具怎么选。
美东时间10月6日(北京时间7日清晨),OpenAI在GitHub公开了722份数学手稿、372组相关成果,出自一个从未公开的内部模型。10月7日,菲尔兹奖得主陶哲轩在个人博客转载了一份人类数学协会(AHM)措辞严厉的声明,呼吁数学家停止与OpenAI合作,争议随后在10月10日至11日冲上热搜。知乎小红书
所以准确说法不是“AI把数学干废了”,它干废的是“答案对了就等于会数学”这个前提。生成答案已经廉价,人类的验证和理解才是稀缺环节。这个瓶颈既发生在数学家的书房里,也原样发生在孩子的作业本上——它正是今天判断一切辅导工具的那把尺子。
这722份手稿到底做了什么
OpenAI的说法是,他们把约4000个数学开放问题一股脑喂给内部模型,最终在372组问题上拿出了结果,覆盖数论、几何、概率、理论计算机等17个分支。平均每个结果大约花掉了3小时ChatGPT Pro级别的思考算力。 做个参照:arXiv每人每月限传两篇,722篇靠人手动上传要传30年,这个量级本身就是信号。微博知乎
最受关注的三项声称:手稿称ζ函数在实部大于7/8的区域一个零点都没有,即“准黎曼猜想”向1/2方向推进了一大步,罗格斯大学数学家孔托罗维奇评价这若是人做的“立刻拿菲尔兹奖”;平面染色问题从2018年确认的“至少5种颜色”收窄到只剩6或7;挂谷猜想四维版本被声称解决,而三维版本王虹与Joshua Zahl到2025年才攻克、王虹今年7月刚领菲尔兹奖。微博
但“有结果”和“有可信结果”是两回事。722篇手稿没有一篇经过同行评审,也没有人类作者署名。发布第2天,OpenAI就撤回了3篇——第一篇该写负号处写成正号,关键抵消不成立,另外两篇建立在同一构造上跟着一起撤回,同一天还有14篇做了修补。有布朗大学的数学家称粗读自己熟悉的领域“不知所云”,一些稿件含糊到连错都谈不上。微博
数学家反对的到底是什么
AHM声明里最核心的一句是:“一次性发布700多个文件,并非学术能力的体现,而是权力的展示”。声明要求数学界回归以人类理解为核心的科学理念——数学共同体要的不是“做对”,是“人能看懂、能检验、能继续往下走”。微博
热搜流传的版本还需要纠一处偏:所谓“数学家联名抗议”的公开信其实发布于手稿上线一个多之前的9月11日,署名者是25位菲尔兹奖得主,包括陶哲轩。信的题目直译大致叫《AI在数学中的严重错位》,它没有反对AI,反而承认AI有潜力增强和加速真正的数学研究,反对的是把“解题”当成衡量模型强弱的尺子。知乎
陶哲轩本人也不是反AI派。10月10日晚他在加州理工做了题为《Math 2.0》的报告,认为在算力供给充分并接入前沿大模型的条件下,人们已经得以在极短的时间尺度内攻克往昔极度艰深的未决问题。小红书那条抵制帖下点赞最高的评论把共识说得很准:抵制的不是AI,是把几百篇未经验证的证明甩给整个学界当验证器的做法。微博小红书
机器检验能部分缓解瓶颈却解决不了全部:Lean形式化证明可以让计算机快速判定一篇证明是否成立,B站就有科普视频拆解这项技术,因为722篇论文让人来读根本读不完。但机器的局限同样明确:它只能告诉你“对不对”,没法告诉你“新不新”“重不重要”“漂不漂亮”。这正是数学界真正焦虑的:生成永远快于理解。哔哩哔哩知乎
数学家的瓶颈,正是孩子作业上的瓶颈
数学家的困境是答案可能对了、人却看不懂;家长的镜像困境是答案出现了、孩子没学会。有初中数学老师在小红书晒出实测:AI做几何题换几个字母就当场“失忆”,那套东西是超级搜索加答案复读,跟理解没关系。数学专业学生的观察更直接:大部分学生把AI当动态答案生成器,直接抄作业了。小红书知乎
更隐蔽的一层发生在机制上:用AI刷题正确率变高、一离开AI就不会做,因为题目一摆出来,AI已经替你把寻找方法的搜索空间压小了,最值钱的思考环节反而没发生。所以选工具的标准数学家已经替你写好了:关键不在答案由谁给出,而在“验证和理解”这一步有没有人真正做过——这个人最好是孩子自己。知乎
四类工具横评:同一批模型底座,差别在“讲与练”做到哪一步
类别 | 卖的是什么 | 价格量级 | 已有公开问题 | 更适合谁 |
|---|---|---|---|---|
通用大模型(ChatGPT、豆包、DeepSeek、Kimi等) | 解题能力本身 | 免费或低价会员 | 会做但不会教,换个说法易答错 | 有自查能力的高年级学生 |
教育垂直App(豆包爱学等) | 讲解、追问、练习的通路 | 免费加会员 | 偶发讲错题 | 家长不会讲的中小学作业辅导 |
拍照搜题/找答案工具 | 答案本身 | 免费加广告 | 实质是抄作业管道 | 家长核对答案,不适合孩子自用 |
学习机/答疑笔(科大讯飞、学而思、作业帮、小猿等) | 硬件加内容生态 | 三千余元至四千余元 | 讲解超纲、应答迟钝投诉集中 | 先线下试用再决定的重度需求家庭 |
通用大模型是免费的基准线。B站有博主把DeepSeek、豆包、千问、ChatGPT等六款模型从小学题测到高考题,逐一对比正确率和讲解方式,各模型差距不小,给孩子用之前值得先用真题测一轮。哔哩哔哩
教育垂直App补的正是“让人看懂”那一半。豆包爱学2024年9月并入豆包产品体系后改名上线,9月的官方升级打通了“讲解、追问、练习、复习”的完整通路,并为学习场景专门打造了2000+项专项能力。教育媒体同期报道其月活约1900万,体量已直逼学而思、科大讯飞把守的硬件生意。但它用的仍是同一代模型底座,讲错题的风险没有消失,用法就得回到上面那把尺子:让孩子追问到能复述。知乎知乎
学习机是最贵的一档。有家长晒单“入了小猿T6pro,价格四千出头”;双11前知乎的学习机选购话题下,好评集中在拟人化AI讲解——口型语调有活人感、不是录像而是AI生成的针对性讲解。公开吐槽同样密集:学而思T6的AI一对一被家长晒单点名“反应迟钝、识别迟顿,答题有时候你问东它答西”。 科大讯飞的AI讲解则被吐槽“有时候讲解超纲,有时候题不是本题”。硬件差价三四千元买的是管控和内容生态,讲题内核与免费App同源——值不值,取决于拿孩子真题现场试讲。知乎小红书小红书
五条避坑线,每一条都有公开案例
第一,搜“哪个好”看到的测评多半是软文。检索“AI搜题软件哪个好”,返回的是整版只夸单一产品、按固定模板罗列功能的推广稿,点赞评论常年为零。连“AI辅导避坑”帖子本身都可能就是营销,判断方法是看有没有横向对比、有没有说缺点、互动数据是否真实。知乎
第二,拍照搜题工具是家长核对答案用的,不是孩子学习用的。对抗早已双向升级:今年数学建模研究赛一道题的官方数据说明PDF被查出埋了96条专门骗AI的隐藏文字,参赛队实锤撞上。出题和批改端都在用AI防AI,孩子拿AI搜题写作业,是在和判卷机器互相博弈。小红书
第三,一切拼课、共享账号、低价代报都要警惕:有人按原价三分之一拼来的海豚AI学课程,一周后账号被限制;也有备考者冲着AI解析功能开了“上岸熊”会员,结果是“一开始AI解析就写得乱七八糟,语句重复、思路紊乱”。借名人数字人形象带货的AI直播课程骗局同样在公开吐槽中反复出现。小红书小红书
第四,别把“会做”当成“会教”,检验只有一个动作:让孩子关掉屏幕,用自己的话把这道题重讲一遍。讲得出来才算学会,看得懂讲解不算。
第五,也别一刀切地禁用。家长的正确目标不是隔绝AI,而是让孩子明白学习目的——哪怕只为考试,也得为了“在考试那种没有AI可用的场景下把题目做对”而学习。会正确使用AI本身就是一种要教的能力。知乎
截至发稿,这722篇手稿没有一篇被期刊接受,部分结论大概率还会在学界消化中被修正甚至推翻,“AI是否做出了真数学”需要时间回答。但围棋的旧事早就给过预演,一条热搜帖子的反问很到位:柯洁输的时候,怎么没人说AI毁掉了围棋?对每个家庭来说,答案变免费之后,唯一确定保值的是孩子那份“能复述、能独立做出来”的理解——工具只负责把题讲清楚,理解只能让孩子自己做。微博