四家AI一起做错的二年级数学题:用AI辅导的家长,先定“谁做标准”,再问“哪家聪明”

源自34位全网作者

18:58

上周有位妈妈把两道二年级数学题分别丢给了豆包、DeepSeek、小猿和作业帮。结果豆包和DeepSeek各只做对一道,方法还绕;小猿只给出一道答案;作业帮一对一错。四家AI,没能凑齐一道完整、二年级孩子能看懂的正确解法。小红书

如果这是孤例,你大可以安慰自己"运气差"。但从去年12月到今年9月,小红书上关于AI答题的吐槽帖排成了一串。四年级作业批改,减法都能算错,追问一句"是不是算错了"它就开始装死机。检查一道题,48+1+1+1它写等于50,反过来把孩子写对的51判成错(8月12日)。初中物理电磁继电器综合题,拍照搜出来最后答案是错的(9月17日)。高中微积分"题看错、解错,还特别犟,死不承认"(9月16日)。公务员言语理解题,粉笔的答案、豆包的答案和评论区网友吵成一片(9月30日)。还有人同题问五次,五次全错。评论区有人贴出记录:同一道错题,9次重复,每次相隔不到一分钟。小红书小红书小红书

四家AI一起做错的二年级数学题:用AI辅导的家长,先定“谁做标准”,再问“哪家聪明”

把这二十来条翻车样本摊开看,错误其实分三类:算错——简单运算链条是通病;看错——拍题认错题干、认错选项,是"拍照答疑"最大的错误来源,有家长发帖吐槽"要么题目审错要么选项看错,提醒几遍还是错",底下19条评论跟着应和。改口且不认错——这是让家长最窝火的一类,"谦虚但总出错"这句评语在评论区拿了32个赞。小红书小红书

真正危险的恰恰是前两类,因为AI"错得特别像对的"。千赞帖里那位妈妈说得很准:过程完整、语气笃定,孩子照着错的思路学,家长一眼根本发现不了。有位家长做过一次最直观的对照:同一页54道口算,里面有两个错,换千问批改全部被圈了出来;豆包却只识别出50道,两道错题一个也没找出来(3月7日)。被绿色对勾盖满的卷子看起来最让人放心,也最容易把错误带进期中。小红书小红书

四家AI一起做错的二年级数学题:用AI辅导的家长,先定“谁做标准”,再问“哪家聪明”

榜单98%和作业题翻车,为什么不矛盾

这周正好有两篇东西把这个疑问拆开了。一篇是知乎10月1日的《AI大模型天梯榜,我替你把水分挤了一遍》——作者先声明这只是三题三模型的小样本对照,不当结论用,但演示很扎心:同一道常识题,对话版22个token、0.7秒答对,推理版多花7倍时间答同一个对的答案,成本差42倍。另一个推理版更绝,把输出预算全花在"内部思考"上,答案还没写出来就被长度截断,交了白卷。另一篇是B站9月16日的AI评测科普,一句话点破:商家都说自己第一,但基准分高不等于实际好用。知乎哔哩哔哩

更值得玩味的是同一天的另一篇:《AI大模型私有题库测评汇总排行榜(2026-10)》直接把矛头对准公开榜单——不少测评题目长期公开,存在被针对性优化的空间,于是作者改用猫榜、致知等几套私有或held-out题集统一尺度重新排名。做榜的人自己开始换尺子,说明标准题集和真实体验之间的裂缝,已经大到圈内人没法假装看不见了。知乎

原因不难理解:榜单测的是一套标准题集的分布,你孩子交上去的是手写体、拍照模糊、带坑的低年级题、应用题——两个分布根本不一样。而且大模型不是"查答案",是每次现场重新"写"一遍解答,同题再问一次就可能换一个答案,这不是心情问题,是生成式输出的本性。评论区老用户的自救方式也印证了这一点:目前没有任何一个AI大模型完全正确,有人用豆包、千问、DeepSeek三个同时问。底下67个赞的回复只有七个字:“然后你会发现全错”。所以问题的根子不在"哪家模型聪明",而在很多家长其实是在让AI"做标准"。小红书

先说一个反常识:高热"避雷帖",不少本身就是广告

这半年最热的几条"AI讲题翻车"帖,点进去看会发现结尾都完成了商业闭环:那条千赞帖最后推荐的就是小猿AI(“30亿真题库+老师人工审核"是厂商话术,不是独立评测结论);944赞、116评的"别乱给娃用通用AI搜题”,帖子本身就是"开学之后陪写作业,检查作业真的太消耗家长精力了"话术开头,评论区清一色客服回应。百度拍题也有对应的"辅导作业别乱选AI拍题"帖(9月28日)。"AI会讲错题"这个社区共识是真的;但"所以要用我家的"是另一回事。挑工具的第一步不是比聪明,是比标准从哪来——挂教材答案、真题库、老师审核的是一类,大模型现场生成的是另一类。作业帮搜题现在全是AI生成答案、想搜标准答案反而费劲,正是9月29日那条吐槽的原型。小红书小红书

按学段抄作业:一份不赌答案的用法

  • 小学低年级:AI只用来"读题、讲思路",不用来"出答案"。口算、应用题的答案以课本和老师的讲解为准;AI的方法和学校方法冲突时,按学校的教——二年级要的是那一种,不是"另一种也对"。

  • 小学高年级、初中:用"2+1"交叉核对——两个不同厂商的大模型,加一个题库类App。三家答案一致再给孩子讲;不一致,让孩子自己复述题目重做一遍,家长拿教材答案定夺。别让AI从"核对答案"滑成"生产答案"。

  • 高中:把提示词改掉:"先别给答案,一次只问我一步,引导我自己推。"知乎那个"用AI刷题正确率变高、一离开AI就不会做"的问题(9月30日)下面,高票回答一语中的:你是让AI做题,而不是和AI学做题。涉及史实、文学常识这类事实题,别要结论,要出处——让AI报章节页码,自己去翻原文,这是小红书评论区验证过省钱又省心的用法。知乎

  • 成年备考(公务员、资格证、国开):以题库标准答案为锚,AI只负责解释"这个选项为什么错",不负责定"答案是什么"。但也不必迷信机构答案一定对AI一定错——言语理解本来就存在争议空间,发帖问"是粉笔错了还是豆包错了"的争议题,评论区一派挺A一派挺B。把分歧本身当训练材料:让两边都写出推理,你自己裁决一遍,比背任何一家的答案都有用。小红书

这套"别信单个AI"的直觉,教育行业里已经有人做成了流水线。9月29日,一个给初中生出题的在线教育平台(拾阶网)公开了AI出题的"五道关":出完题不让模型自己审,因为让模型带着答案自查,做的不是重算而是替答案找解释,一个错答案它能推导得严丝合缝。要换一套独立工具重算:让模型写Python、用符号计算从头算一遍,还专门留着"算不出来"的出口(不留,模型就会硬凑一个"验证通过");再换视角把题重做一遍查歧义;四道机器关之后仍是人工抽检兜底。知乎

作者有句话值得所有家长抄下来:错题的代价和对题的价值不在一个量级上——这道题没让孩子少拿几分,它教会了孩子一件错事。家庭版验证用不着符号计算,把顺序记住就行:先算、先做,再比对,别让AI先看结论。知乎

四类题别交给AI定夺:多步运算链条、拍照识别的手写题、奥数坑题、答案直接决定得分的题(考试、填报、缴费类判断)。

四家AI一起做错的二年级数学题:用AI辅导的家长,先定“谁做标准”,再问“哪家聪明”

接下来盯什么

接下来两个月可以留意各家教育AI的"正确率"口径:谁给出了测试题型和分布,谁只喊一个百分比。以及下一次模型发布,别问"变强了多少",问"它开始做对哪类题"——榜单是快照,不是合同,这是这篇对照实验文里最值得记住的一句话。知乎

家长问"哪个AI最聪明",多半是想找一个能直接抄的答案。但这件事真正的结论不在榜单上:先定了标准,AI哪个都能当助教;让AI做标准,排名第一的也是赌。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章