日本44亿日元给AI"投毒"冲上热搜,知乎70万人围观的实测却吵翻了:同一个ChatGPT,日语问和英文问是两个口径——把官媒调查、用户实测、评论区分歧拆开看,再决定查资料时还能不能信它

源自47位全网作者

00:12

9月18日,#美国大模型已被日本错误历史观污染# 挂上热搜。如果你这几天刷到过,第一反应大概是愤怒,第二反应是疑惑:我天天用的ChatGPT、Gemini,真被"投毒"了?被投到什么程度——是全盘改口,还是个别措辞?

这个问题,官媒调查和用户实测给出的答案不完全一样。把三层信息拆开看,你会发现真正值得带走的,不是"卸载还是原谅",而是一套查资料时用得上的判断方法。

一、先看官媒说了什么:一条从"源内"开始的链条

这件事的起点不在9月。8月15日,日本宣布无条件投降81周年当天,玉渊谭天发文披露:日本数字厅在2025财年补充预算中拨款44亿日元,建设一个名为"源内"的生成式AI业务辅助系统——2025年已在数字厅试点启用,2026年向约18万名政府职员开放。这套系统接入的是以Anthropic的Claude为代表的美国大模型。玉渊谭天

谭主列出的细节相当具体:为建设"源内",日本数字厅牵头收集了约1800万页政府数据,包括内阁决定、国会会议记录、白皮书,以及1947年5月至今近80年的官报。玉渊谭天

谭主真正担心的是一个循环:"源内"生成的内容会进入政府报告、白皮书等公开文件,这些打着"官方"标签的AI输出,又会被其他大模型当作"高可信度"来源抓取——AI污染AI,层层回流。谭主还提到,已有日本大臣承认自己的国会答辩稿是用"源内"生成的。玉渊谭天

9月17日,这条线有了新进展。谭主在北京香山论坛碰到了日本前首相鸠山由纪夫,后者坦言对这个现象"非常担忧",认为AI使用方式不当可能变得非常危险。同一天,谭主公布了新一轮测试:用日语分别向ChatGPT、Gemini、Grok、Perplexity等大模型询问一系列二战相关问题,发现大部分回答"已经与日本右翼立场高度一致",且绝大多数回答频频引用日本国立公文书馆——相当于日本的国家档案馆。谭主的追问是:它怎么不引用我们的档案馆?微博知乎

二、再看用户实测:知乎高赞答案给出了不太一样的结果

知乎上"媒体称美国大模型已被日本错误历史观污染,有哪些信息值得关注"的问题创建于9月17日晚,两天多冲到约70.9万浏览。其中一份高赞实测(700多赞同、200多条评论)做得很扎实:作者用日语向网页版ChatGPT 5.6 Sol提了六个问题,并把回答一字不差贴了出来。知乎知乎

第一个问题就是"介绍一下満州国"。模型的回答里明确写着:它"在形式上是一个独立国家,但实际上处于日本、尤其是关东军强大的政治和军事影响之下",“在当今的历史研究中,通常将其视为日本的傀儡国家”;1931年的柳条湖事件"实际上是由关东军军官策划的";讲到国际联盟派李顿调查团、最终拒绝承认、日本退出国联;也讲了满蒙开拓团迁移中"中国农民土地被征收"、产生"中国残留孤儿"等问题。单看这份回答,事实框架并没有塌。知乎

于是在评论区,吵出了三种声音。第一种说"挺客观的,资料证据都摆了,怎么判断是你的事";第二种贴出模型谈慰安妇问题的原文——“其中有通过招募业者募集而来的女性,也有原本从事卖春业的女性,还有一些女性因为贫困或家庭原因签订合同”——认为这种把"强征"拆成"来源多元"的写法是避重就轻;第三种技术派点破了关键:“GPT的逻辑是不能单独采信中方控诉或日方申辩,能作为事实陈述的只有经过审判确定的罪行,以及日方明确承认的罪行,有一点无罪推定的意思,看起来自然就有倾向日方的倾向”。还有人补充:英文版GPT甚至对日本右翼历史观点做了一串嘲讽。知乎

同一个模型,日语问、英文问,官媒看到"高度一致",用户看到"相对平衡",还有人看到"嘲讽右翼"。到底谁对?

三、答案都对:拆三层看"污染"到底是什么

第一层:污染不是开关,是分布。没有人往模型里灌一瓶毒药让它全盘改口。真实发生的是信源分布的倾斜——在日语语料的世界里,日本国立公文书馆、国立国会图书馆这类官方机构的文本权重天然就高。模型回答二战问题时引用谁、把谁当"权威",重心就会往那边偏。谭主看到的是"引用名单清一色日方机构",用户看到的是"事实框架还在",两者并不矛盾:框架没塌,但重心挪了。

第二层:语言切换就是语料池切换。同一个模型,用日语问、用中文问、用英文问,调用的语料分布和检索结果不同。你用中文问,大概率拿到接近中文互联网口径的答案;换成日语问,日方官方叙事的浓度立刻上来;英文问又是一个口径。这不是玄学,是训练数据和检索机制决定的——也是为什么不同人测同一个模型会得出完全相反的结论:他们其实测的是三个不同的"语料池"。

第三层:证据标准的"无罪推定"。模型的写作惯例是:经过审判认定的(比如东京审判)和日方明确承认的罪行,才写成"事实";双方的指控和申辩,一律降级为"主张"和"争议"。而历史观的分歧恰恰就住在这些"降级"里——“强征"被写成"募集渠道多样”,就是这套证据标准的直接产物。这不是替模型开脱,而是指出一个事实:它的"中立"是程序性的中立,不是立场性的中立。程序中立套在有争议的历史上,产出必然让某一边不舒服。

所以"被污染了吗"这个问题,比较诚实的回答是:没有到"洗白"的程度,但信源倾斜和措辞降级是真实存在的,而且在日语场景下最明显。

四、对你实际的影响:查资料时多做三步

先分清场景。写代码、翻译文档、做表格、查参数,这条新闻跟你没关系,该用用。受影响的是历史、地缘、争议类议题——在这些题目上,AI是索引,不是终审。

具体三个动作:

1. 换语言交叉验证。同一个问题,中文、英文、日文各问一遍。三个口径差得最多的地方,就是立场最浓、最值得警惕的地方。这个动作两分钟就能做完,比任何"AI测评"都直观。

2. 让它列信源。追问一句"这个结论引用了哪些来源",看名单构成。如果清一色是单边机构——不管偏向哪一边——这个回答就只能算单方陈述,不能算综合判断。

3. 盯住措辞降级。“侵略"写成"进出”、“强征"写成"募集”、只在"満州国"后面加一句"这是有争议的表述"——措辞降级比事实错误隐蔽得多,也有效得多。事实错误你一查就穿帮,措辞降级会让你在不知不觉里接受一整套口径。

五、一个值得长期盯的信号

这场热搜真正的行业意义,是日本用44亿日元做了一个示范:把政府数据灌进AI,AI产出官方文件,官方文件再回流成训练数据。如果这套循环被验证有效,各国政府大概率都会跟进——你未来用的每一个模型,信源清单里都写着地缘政治。

对普通用户来说,这堂课的结论不是"别用AI",而是:大模型的"客观"是统计意义上的,不是价值意义上的。它替你看过的每一份档案,都是别人先挑过的。热搜会过去,这个判断方法不会。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章