张大妈

AI也会把正负号写错:OpenAI撤回3篇数学手稿后,学生用AI写作业怎么避坑

源自115位全网作者

13:10

2026年10月6日,美国时间,OpenAI在GitHub上线了一个数学仓库,一次性放出722篇由未发布内部模型产出的数学手稿,对应372组结果,覆盖数论、几何、概率、理论计算机等17个方向。不到24小时,10月7日就有3篇被撤回、14篇被修订——毛病出在该写负号的地方写成了正号,一步关键的抵消因此不成立,建立在同一个构造上的另外两篇跟着一起倒下。对用AI写作业的学生来说,这件事值得抄在笔记本首页的一句话是:AI的风险从来不是"不会做",而是"信心十足地做错、而你分辨不出"。避坑的办法不是戒掉AI,而是把每一份AI输出都当成一篇没经过同行评审的手稿,过一遍命题、复现和规则三道关。知乎果壳

一个正负号带走3篇:AI出错的三种方式,每种都对应一个作业坑

第一种错法,就是这次撤回的低级错误本身:单个符号写错,整条证明作废,连带引用的成果一起塌。学生这边一模一样的形态是——AI给出的解题步骤每一步都写得流畅,符号或正负恰好错在关键一步,照抄进作业本,错误就原样"入库"。流畅感是最不可靠的质量信号。

第二种错法更隐蔽:被"验证"过的,可能根本不是你的题。目前这批结果约42%(300/719)配了Lean机器形式化验证,但形式化只能保证"写进Lean的那个命题"被证明了;命题是否忠实对应原题需要人另行核对,有的机器检查覆盖的甚至只是配套结果,而非论文宣称的主定理。落到作业上:让AI"自己检查一遍"、让代码"跑通",都不等于它解的是题目给的条件下那个问题;AI引用的定理、套用的公式变体、列出的参考文献,可能看着齐全,实则对不上,甚至不存在。知乎

第三种错法:发布方自己都没读完。这722篇手稿没有一篇经过同行评审,也没有人类作者署名,连OpenAI自己的研究人员都没通读过;尽管发布前咨询过数学与AI顾问小组,其流程仍被指缺少对人类理解、形式化验证和同行审查的充分保障。几秒钟生成千字作文,只代表产量,不代表里面有任何一方真正理解过它——包括AI本身,也包括照抄的你。果壳IT之家

比出错更贵的坑是外包:2.6万名中学生的追踪数据

OpenAI的撤回风波说明AI会犯错;一项覆盖中国一个县26811名初高中学生、最长达30个月的追踪研究,则说明了"让AI全权代劳"会付出什么。科普中国

结果是:学生开始用AI做作业后,周末作业分数平均提高约18%,每份作业从领取到提交的时间从约64分钟缩短到45分钟,但校内闭卷月考平均成绩下降了约20%。需要说清边界:这是一项观察性研究,样本限于一个县,开始使用时间靠学生事后回忆,百分比是模型估算的平均变化。科普中国

损失并非均匀发生,而是集中在"外包"行为上:在用AI超过五个月的学生里,81%被归入作业完成时间明显过短的"外包"组,学习损失也主要出自这些组;即使用了AI、但完成作业时间和不用的同学相近的学生,学习损失很小。更反直觉的是,原来成绩排前三分之一的学生,估算降幅(月考约24%)大于后三分之一的学生(约16%)——把AI当枪手的优等生,塌得最快。真正该问的不是"用没用AI",而是AI在作业里扮演什么角色:资料助手、编辑、导师,还是从审题到成文全包、只剩"提交"这一步的枪手。科普中国

红线与露馅:把"辅助"用成"代写"的代价

规则侧已经划了线:《中小学生成式人工智能使用指南(2025年版)》明确不应把生成内容简单复制为作业;北京市教委发布的2026版应用指南则要求,小学阶段学生不建议独自使用AI工具。科普中国中国青年报

而"会不会被发现"从来不该是学生的决策变量——事实上露馅的方式远比想象中多:语气前后不一、超出本人水平的排比句、忘删干净的提示词,在作业社区里早就被当成最典型的AI痕迹,一眼就能看出来。更糟糕的路径是反向花钱:为了逃避检测去买"降AI率"工具、用AI洗AI,相关乱象已被媒体集中报道。这类操作把"如何使用AI"的灰色地带,直接升级成学术不端风险。小红书知乎

避坑清单:像审稿人一样用AI

把这五步当成固定流程,比任何"检测对抗技巧"都可靠。先独立动笔,再找AI:自己写下第一步和卡住的位置,然后让AI提示、追问、举反例、指出错误,而不是索要成品;研究显示,作业耗时没有被大幅缩短的学生,几乎不付学习代价。核对命题:逐项确认AI用到的定理、公式、数据条件对得上你的题目——OpenAI那3篇,恰恰是发布前没人做这一步。引用逐条验证:AI给出的每一篇文献、每一条数据,打不开、查不到就不用。关AI重做:合上屏幕,能向自己解释每一步、能重做一遍、能换一道变式题,才算学会——这是数据里唯一站得住的检验标准。按校规申报:交作业时分清哪些任务允许AI协作、哪些必须独立完成,如实标注使用方式;规则线内的"辅助"没人罚,规则线外的"代写"迟早爆。

OpenAI握着最强的算力、机器验证和一支含三位菲尔兹奖得主的顾问团队,仍然被一个正负号撤下3篇成果。这个热点给学生的真正提示是:缺的从来不是更聪明的模型,而是"检查"这个动作本身——AI可以参与你的作业,但闭卷考试、答辩和未来的面试,都不会有AI替你按键确认。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章