9月8日之后,每天拿AI刷题、拍题、查资料的人,刷到的世界是分裂的。一边是"经合组织报告:频繁使用AI完成学业的学生成绩更低",配上"低28分≈落后一年半"的转发版本,家长群刷屏。 另一边是科技日报9月10日发起的话题,标题直接写"别被网传结论带偏了!报告还有后半段"。 同一份报告,两天内被两个方向的账号轮流引用,像极了每次AI热点的标准剧本。财联社科技日报
如果你本来就是靠AI答题解疑过日子的——考公刷题让它讲言语理解,高数卡壳让它列步骤,写周报前让它先查一圈资料——这篇不劝你退坑,也不替你喊"AI改变学习"。它只做一件事:把这份被转了几百个版本的报告拆开,看原始数据到底说了什么、没说什么,再给你一套比"信或不信"更有用的处理办法。
原报告说了什么
先纠正一个连标题党都搞错的事:这一轮评估的官方标注是PISA 2025(结果于2026年9月8日公布,PISA按评估年份命名),但热帖里已经在叫它"PISA2026"——传播还没开始,名字先错了,这就是链条会失真的第一个预告。微博
被引用最多的"28分",原文是这么说的:科学测试中,表示从不或几乎从不用AI给写作作业起草文本的学生平均509分,每天或几乎每天让AI起草的学生平均481分;调整社会经济背景后差距仍是28分,约等于一年半的教学进度,在"针对新主题做初步资料搜集""总结指定阅读材料"等场景也出现按频率递减的类似规律。财联社
这次结果于周二公布,样本覆盖91个国家和地区、超过76万名15岁学生。财联社
把报告按使用频率分组画出来,大致就是这条递减线——以"概括所读文本"类题目为例,从"几乎不用"到"每天用"一路走低,调整后差距依旧:

对着这条曲线,能钉死三个边界条件。
第一,“低28分"精确对应"让AI代笔起草”,不是"拿AI答疑"。 起草写作作业,是AI替你输出成品;拍一道不会的题、追问一句"这步为什么这么移项",是AI给你提示再由你自己算。两件事在认知上完全不对称,热搜标题却把它们合并成了"用AI"。转发版本里"用AI写作业"五个字,把最关键的限定语丢掉了。
第二,报告自己留了后半句。 科技日报说的"后半段"确实存在:真正被数据点名的,是"几乎每天用AI概括或撰写所读文本"的学生,而对报告所称用AI帮助学习的用法,负面影响明显更小。微博
报告转述里,OECD教育与技能司司长安德烈亚斯·施莱歇尔的原话更冲——“你不能靠看体育比赛来健身。如果学习很轻松,那就不是学习”。 这句话值得细品:它批评的是"轻松",不是"工具"。微博
第三,这是相关性,不是因果。 自报"我天天用AI起草"加上同一次考试得分低,至少可以反过来解释——学得吃力的学生更依赖AI。何况同一时间轴上整条线都在往下走:高收入国家的15岁学生,读写与推理水平比2015年落后约一年半;今年7月公布的NAEP里,美国学生的数学水平退回上世纪90年代。 把整个世代的下滑全部记在AI头上,证据走不到那一步。至于辟谣方,也没给全答案:科技日报的完整解读封在一条48秒的视频里,文字层面看不到,两边吵得热闹,普通读者手里其实只有一张电稿截图。微博
传播链是怎么把图景改画的
对天天用AI答题解疑的人来说,这一周真正值钱的是一份现成样本:你每天消费的"AI答案"——无论来自模型还是媒体——会怎样在转发里一步步变形。把这次的链条摆出来:报告发布 → 财经媒体取最扎眼的单点对比做标题(509对481)→ 博主把"起草作业"压成"写作业"、把两个不同口径的"一年半"并成一个 → 情绪话题标签二次分发 → 辟谣方用"还有后半段"对冲但不给全文。每一环都只拿走一块拼图,没有任何一环有义务把边界条件还给你。
连图表都在被各自重画。这周被转得最凶的一张三科趋势图出自外媒对同一轮测试的报道,标题就是"青少年是不是越来越不聪明了",把OECD国家的成绩解读成崩塌式下行。经济学人

它没有错,但它选的是"整体下滑"这条线;而"AI使用者vs不使用者"那条线,要换一张图才看得见。同一份报告,选哪条线做标题,决定了你今晚刷到的是"AI恐怖故事"还是"教育结构性问题"。
这也是为什么社区里用得最久的土办法反而最能打:知乎上有用户总结多平台核验的经验,答案一致可以先用,答案打架就默认进复核队列。 错误是个体户,正确才有共识。但它有盲区:多个账号可以引用同一份电稿,多个模型也可能吃了同一批语料——"一致"只能当及格线,不是验讫章。知乎
不同问题,给AI的信任额度不一样
把社区半年来的实战经验和几项研究摆在一起,基本能拼出一张"信任额度表":
接近直接可用的: 有标准流程的题。小红书上有备考博主把AI逻辑链做成行测语句排序的固定解题套路。 知乎那个浏览量52万的"用AI考公务员是不是秒杀活人"讨论里,有人专门改了选项让AI重答来验证它没从网上抄答案,它照样能自圆其说。 这类题AI答得快、过程完整,适合当陪练。小红书知乎
要抽查过程的: 数学、物理这类分步骤的题。那个浏览量350万的名场面别忘了:有用户晒儿子问DeepSeek一道物理题,它算了五分钟,"心路历程"的最后一步是搜答案。 答案对了不等于过程可信。有评测研究批评过这个盲区:几乎所有科学推理基准只比对最终答案,"答案正确等于会推理"这个假设从没被认真检验过。 核对AI解答时别只看结论行,中间步骤会不会用,才是它的真实水平。知乎知乎专栏
必须回到一手来源的: 事实、数据、政策、医疗。四大会计师事务所研报被曝集体踩AI幻觉的那周,有从业者在知乎上说得很实在:AI的初稿比你自己瞎琢磨强,但准不准是另一回事。 医生群体的用法是个好参照:有外科医生分享的套路是固定用深度思考模式跑一遍,再逐条回查文献——AI负责缩小范围,不负责下结论。知乎小红书
直接降权的: 任何用单一数字承诺效果的软文。搜索页里躺着"学生使用AI学习工具后效率提升52%""长期使用成绩平均提升30%“的"实测”,样本、对照、口径一概没有——和"低28分"是同一级别的传播物。今日头条
还有一个选型维度最近被认真聊了起来:不同模型的"嘴硬程度"不一样。有用户在讨论评测榜单时引用数据称,DeepSeek弃答率仅1.9%左右,调性是"你甭管对不对,我反正都会答",而GLM、智谱系风格明显不同。 这组数字我没有从原始榜单核实,只能存疑引用;但方向对得上社区的体感:需要"先给个答案往下推进"的场景,和需要"不知道就敢说不知道"的场景,选的不是同一款。把同一道题丢给一款激进的和一款保守的,比丢给两款激进的互相抄,信息量大得多。知乎
那到底该不该继续用AI答题
PISA这类数据能支撑的结论,说到边界就停了。它没有、也暂时无力回答的问题是:一个学生先自己想、卡住了再问AI要提示、并且复述回去验证——这种用法分数会怎样。这类"怎么问"的变量,被"用/不用"的二分法整个吞掉了。
在研究补上这块之前,可以照这个顺序给自己立规矩:先自己走完一遍再问AI,让AI当判卷人而不是答题人;问过程和依据,别只要结论;跨平台答案不一致的题,默认进"回一手来源"队列;涉及金额、健康、考试规则的,模型说得再顺也只算线索。
学术界在往这个方向补课。被量子位报道的一篇ICML’26论文走的是"零来源检测"路线:不查外部资料,只靠按人类标准设计的追问,判断这一答值不值得信,报道给的检测准确率数字是88%。 看论文的结果图:以Qwen为基座,用TriviaQA、SciQ、NQ Open、CoQA四类问题互测,AUROC矩阵里大部分格子站上88(满分100)——所谓"88%“的原形在这里,是"检测幻觉"的判别指标,不是"AI答题考88分”,又是一个可以被随手标题化的数字:量子位

工具会越来越多,标题党也会。至于"低28分"要不要恐慌——更值得花五分钟的,是盯两个后续信号:OECD报告"辅助型使用"的单列数据会不会有人完整整理出来,以及各家模型评测会不会把"弃答率"从榜单脚注搬进正表。那才是这份报告真正欠所有AI用户的答案。