9月14日,一位陕西家长在小红书发帖「科大讯飞学习机踩雷❗AI批改对错颠倒」:孩子写对的题被判错,写错的答案反而打勾,连机器自带的解析答案本身就是错的。她找售后,客服只要了序列号、说后台推送系统升级;升级完再测,判题出错的老问题依旧。小红书
第二天上午,「科大讯飞AI学习机小飞老师」的官方账号出现在评论区,回复称售后已私信跟进。官方账号下场回帖的速度,侧面说明这类帖子现在有多受盯着。
而且不止她一家。9月13日,一位B站UP主用AI批改七年级数学试卷,自己的结论是「这个结果有点惨」。8月中旬,另一位家长投诉作业帮学习机「批改六年的题,讲二年级的」,到店讨说法,门店给的解释是「太简单,识别不了基础题」。哔哩哔哩小红书
同一套智能批改,学校好评,家里踩雷,中间差了什么
同一时间窗里,主流媒体的报道是另一个故事:科大讯飞星火智能批阅机进了深圳多所中小学,龙华高级中学教育集团观澜校区的数学老师说,每天批改作业省下1.5小时以上。报道同时写明,智能设备承担的是扫描、识别、基础批改、错因归类这些重复性工作。政策面也在推——据媒体报道,2026年4月教育部等五部门联合印发《「人工智能+教育」行动计划》,明确提出推进智能批改、答疑和辅导。中工网今日头条
同一家的「智能批改」,进学校是帮老师减负,进家门成了踩雷帖。差别不在机器,在最后一道闸:学校的机器批完,有老师复核、由老师对结论负责;家里的学习机批完,那个对勾直接成了终审。我们这代家长开学第一个月做的真实升级,其实是把每天检查作业这半小时外包给一台大几千的机器——但很少有人追问:机器错了怎么办?
「AI批改」不是一个功能,是三道工序,各错各的
把踩雷帖里的故障拆开看,「AI批改」其实是识别→判题→讲解三道工序,错在哪一道,对策完全不同:
第一道:识别。 机器得先「看见」孩子的字。识别环节翻车的症状很明确:提示无法识别、3看成8、把订正痕迹当答案。9月14日帖子的评论区就有家长提醒「有没有可能写的字识别不了」。作业帮那起「太简单识别不了基础题」的门店解释,问题大概率也出在这一环。小红书
第二道:判题。 机器来定对错。「写对被判错、写错反而打勾」就是这一环:多数时候不是题算错了,而是对错匹配环节拿错了标尺。
第三道:讲解。 机器给出题解析。「批改六年的题、讲二年级的」「自带解析本身就是错的」属于这一环。这一环错得最隐蔽,伤得也最深——错的不是一个题的分数,是孩子的理解和信任。
分清三道工序的意义在于:识别环节的问题,把字写工整、重新拍一次能救;判题和讲解环节错了,怎么重拍都还是错的。分不清是哪一环,就会把「机器不行」和「孩子字太潦草」混为一谈。
准确率的三个版本,和没人说的那件事
关于AI批改到底准不准,市面上流传着三个版本:
宣传层:家长帖子里引用的「跟中高考阅卷同源技术」,出自品牌方宣传话术。小红书
销售层:9月15日评论区,一位浙江家长转述「卖我科大的销售说,AI批改的准确率是80%左右」——注意这只是用户转述的销售说法,不是任何官方口径,但至少说明连卖机器的人心里都没把这台机器当100%;
用户层:同一评论区的共识是「作业批改,没有任何一家学习机能达到100」,家长的自救办法是「有疑问的题,多找几个软件多批几次」,结果引出那句黑色幽默——「几个答案,各有各的答案」。小红书
必须如实说清的一点:截至今天,我们没有检索到任何公开的、可核验的第三方对「学习机作业批改准确率」的实测报告。厂商话术和用户体感之间,是空白的。这意味着你家机器的真实准确率 = 机器能力 × 你孩子的字迹 × 题型分布,三者都因人而异——这个数字只有你自己测得出来。
期中前,花20分钟做一次「校准测试」
距离期中考试还有三四周,这个周末就能做:拿孩子本周做过的10道题(覆盖计算、填空、解答三种题型),先让AI批改,再自己逐题核对。
这个数字比看任何一篇测评都管用,重点看两件事:错了几道,以及错在哪道工序——
错在识别(字迹):让孩子写工整再批一遍,能救,继续用;
错在判题或讲解:这类题以后永远不能全信机器。
结合本轮踩雷帖和正面反馈的分布,给一个分工建议:可以主用机器批——口算、听写、选择题等答案唯一的基础题(正面好评几乎都集中在这里,查计算是各家学习机最稳的场景);可以用但必须复核——作文语法标注、题目讲解,机器解析相当于一个资质没验过的二老师;绝不能外包——主观题给分、错因判断(到底是公式没学会还是粗心)、以及学情报告里「薄弱点」的定性结论。学校报道里那句定位值得抄给所有家长:机器接管的是重复劳动,不是判断。
两个售后动作顺手做掉:发现错批,当场拍原题、截图机器判定结果——这既是找客服升级的依据,也在退换货举证窗口内;客服推「序列号升级」的,升级前记下出错原题,升级后重测这几道题,别接受「已优化」三个字。
接下来盯三个信号:各品牌9-10月系统更新日志里是否出现批改类修复说明;《「人工智能+教育」行动计划》落地细则会不会给家庭端智能批改带来口径或规范;消费者组织后续比较试验是否把AI批改准确率纳入测试项——过去的学习机比较试验测的多是硬件和课程内容,这一项长期空白。
学校那篇报道里有一句话,值得贴在学习机背面:智能设备能承担扫描、识别、基础批改、错因归类,但「并不替代教师的判断与关怀」。中工网
家里的逻辑一模一样,只是换了主语:机器能批改,但批改错了,机器不负责。对勾后面,家长才是最后一道批改。