暑假过了大半,不少孩子还欠着暑假作业里的"小练笔"和周记作文。很多家长已经学会了一个省事办法:拍照发给AI,不到一分钟,分数、逐句修改、总评全出来了,看上去比自己憋半天写的意见专业多了。
但最近,这份"专业感"正在集体翻车。
同一篇作文,AI自己都吵不出统一意见
7月初,人民网"人民直击"发过一组调查:同一篇作文提交到同一个平台,上午被判定"一类文",下午再次提交却只被评为"良",分差最高10分,而原文并未作任何改动。人民网报道附的对比图里,一边写着"上午输出结果:得分92分",另一边同一篇的"下午输出结果"直接掉到82分。
换平台,差距更夸张。同一份报道的另一组对比里,同一篇《一、二、三个木头人》,一个平台给82分"良",另一个平台只给57分"D-"。杭州一所小学语文老师做的人机对照实验也是类似结论:全班45篇作文的批阅报告里,其中20篇与她的评分相似,10篇存在小偏差,还有15篇存在较大偏差。人民网浙江频道也就是说,三分之一的作文,机器和老师的判断差了一档以上。
就在昨天,小红书上还有考生在晒同一类遭遇:同一篇论效文,一个工具批完另一个工具批,“差距居然有11分”,而上一篇两个工具给的还都是13分。小红书评论区里不少人跟着吐槽:“个人感觉豆包不行”“我也感觉它很多地方批的都太严了”。
这是工具不成熟吗?不全是。知乎上有老师把学术端也梳理了一遍:2022到2025年间多篇大模型作文评分研究里,人机评分的Pearson 相关常见落在约 0.30~0.80,QWK(二次加权 Kappa)也多在 0.30~0.80——总体是中等到良好一致,不是「永远贴着老师」。知乎所谓"相关高",只说明AI擅长排座次——分得出哪篇更好、哪篇更差——并不保证它对每一篇都和你给出同一个分数。
为什么AI批不准:它看的是"写没写清楚",不是"写得好不好"
道理拆开不难懂。AI的评判标准基本是表层特征:结构完不完整、段落衔不衔接、有没有错别字和语病、用没用比喻排比。这些它一学就会。但真正的好作文,往往赢在另一层。
知乎一位家长拿孩子的作文实测过:儿子那篇《我的爸爸》拿了全班最高分,语文老师专门在班上读,夸"写出了散文的味道"。孩子写的是"爸爸从来不送我上学,但每天放学,他的电动车一定停在校门口左边的第三棵树下"——不说爱,但处处是爱。AI批这篇,只给了78分,建议"增加具体事例,提升情感深度",而那篇作文之所以能拿高分,恰恰是因为它没有堆砌事例。知乎AI看得到字,看不到情。
小红书另一位家长晒出AI给娃作文写的旁批,越看越"给我气笑了":孩子把《龟兔赛跑》脑洞重写,AI一本正经地批情节逻辑矛盾,说乌龟"听到吃的才救人"略显功利,建议"若能加入对朋友安危的担忧,情感会更真挚动人"。

它像一个极其勤奋的阅卷机器:能看出字写得是否工整、段落是否清晰,却读不出藏在文字背后、独属于一个孩子的细腻和敏感。所以拿娃作文实测的那位家长最后的结论是:AI批改作文,可以信,但不能全信。知乎
AI批改的四档可信度
那是不是就该把它扔了?也不是。把"批改"拆开分档用,它依然是个好帮手。综合各家实测,可以按这四档对待:
第一档:错别字、语病、标点——可信。 这是AI最稳的能力,相当于一个不烦、不知疲倦的校稿员。让孩子交稿前先自查一遍错字和病句,省时间,也不会误导。
第二档:结构、逻辑、跑题提示——值得参考。 “故事稍显平淡,情节缺乏起伏”"结尾略显突兀"这类结构性意见,是AI的强项。有截图里,AI甚至给孩子列出了开头、中间、结尾分别写什么、伏笔埋在哪,比不少作文辅导书还细。

第三档:分数和等级——看区间,别看单点。 真想看分数,就把同一篇丢给两个不同的AI,把两个分当成一个参考区间;差距大时,要么信低的,要么只看两边共同指出的问题。这套逻辑对雅思、考研、四六级的备考党同样成立:分数看看就好,问题清单才是真货。毕竟在B站,都有学生研究出怎么让AI直接批60分及格了,中国人最会的就是卡bug!哔哩哔哩一个能被"指挥"的分数,本来就不该当裁判。
第四档:立意和情感评判——别信。 主题深不深刻、情感真不真挚,是人类的领地。AI给你打60分的那句话,可能恰恰是孩子琢磨了一晚上、值得打100分的那句。
三个即拿即用的正确用法
用法一:要问题清单,不要分数。 把"这篇作文多少分"换成:"请以X年级语文老师的身份,逐一列出这篇作文的错别字、语病和结构问题,并给出修改建议,不需要打分。"小红书上有一位语文老师已经把这套思路用在全班身上:周五加班加点改完作文,周末让学生拿回家抄写。小红书她给AI下的指令值得直接抄作业:以三年级语文老师的身份,按部编版习作要求修改润色,保留原有意思,“不要过于华丽”,还限定了字数。

用法二:双AI交叉,只看问题交集。 同一篇分别交给两个不同的AI(比如一个豆包、一个DeepSeek),两边都点名的问题是高概率真问题,优先改;只有一边提到的,让孩子自己判断。分数差异直接忽略。
用法三:批"改后稿",不批"第一篇"。 孩子按建议改完,把新旧两版一起发过去,让AI说清"第二版比第一版好在哪"。这一步把AI从宣判官变成陪练,孩子也能亲眼看见自己的进步落在哪里。
最后,一条红线
2025年底,教育部教师队伍建设专家指导委员会发布的《教师生成式人工智能应用指引(第一版)》已经写明:教师不得将生成式人工智能对作文等作业的自动批改结果作为学生最终评价予以直接使用。人民网四川频道这条红线划定于2025年11月。现代快报
对家长来说,这句话有两层意思:在学校,作文的最终判断权在老师手里,AI最多算助教,别拿着AI的分数去质疑老师的评分;在家里,连教育部都不让AI分数当最终评价,我们就更别把它当真——真正有用的,是分数后面那份问题清单。
开学就在眼前。AI可以当手电筒:帮你照亮错别字、照亮结构漏洞、照亮修改方向。但记住,手电筒不是裁判。作文好不好,最后还得你自己一句一句读。