先说一个AI重度用户都熟悉的场面:写方案、做PPT、赶论文,急需要一个数——“全球失学儿童有多少”“某国人均预期寿命”“去年全球城镇化率”。你随手问AI,它秒回,数字精确到小数点后一位,语气笃定得像央行年报。你敢直接抄进去吗?
这周,联合国替所有人把这口气测明白了。
一、13.3万条回答,平均准确率21.2%
联合国儿童基金会(UNICEF)的首席统计师João Pedro Azevedo带队,拿六款主流大模型,针对全球发展指标相关问题生成了超过13.3万条回答,结果平均准确率只有21.2%。 被测名单你可能都眼熟:OpenAI的GPT-4o和GPT-4o-mini、Anthropic的Claude Sonnet 4.5和Haiku 4.5、谷歌的Gemini 2.5 Flash和2.0 Flash。36氪雷科技
三个数字比那个总分更值得记:
大概五分之三的回答,根本给不出一个能用的数字,模型全程含糊其辞。雷科技
同一批问题隔两天再问一遍,两次都提供了数字的模型中,只有大约一半返回了相同的数字。你今天问和后天问,AI嘴里的"权威数据"自己就打架。36氪
这还是联合国自己的统计专家、用自家数据出题、主场作战的结果。
换句话说,你随手一问拿到的那个漂亮数字,大概率不是"查到的",是"编得像的"。

当然,往这盆热水里也得兑两勺冷水:这份测试目前还是工作论文,正准备投期刊,还没过同行评审。 测的也多是上一代的中端型号,不是你今天手上开满血档的旗舰。但它戳的那个结构性问题不会因为模型换代就消失——只要训练语料里同一个指标躺着不同年份、不同口径的版本,模型就永远有"挑一个最顺眼的数"的冲动。36氪
二、为什么AI偏偏在数字上最容易翻车
知乎上"怎么解决生成式AI给出的数据不准确的问题"这类问题,今年下半年就没冷过。B站那边更狠,一条"又一个把AI幻觉当真的孩子"两天19万播放,评论区全是被AI数字坑过的难兄难弟。
翻车的原因其实不神秘:
数字是长尾。全球发展指标这种数据,训练语料里出现的次数远不如"怎么做红烧肉",模型对它们没有稳定的"肌肉记忆",只能靠概率硬凑。
口径打架。同一个"城镇化率",联合国、世行、各国统计局可能各有一个版本。企业里也一样——三个部门问同一个问题得到三个答案,不是AI算错了,而是"到底哪个是对的数"本身就没定下来。知乎专栏
AI不爱说"我不知道"。对模型来说,编一个格式完美、来源模糊的数,比老实承认"查不到"的"代价"低多了。谷歌Data Commons团队负责人Prem Ramaswami自己也承认:给AI提供权威数据,并不一定会让AI给的结论具有权威性,“引用或发布之前,最好还是有人把把关”。雷科技
三、联合国的解法:把数据改成"AI能直接吃"的格式
也正是在这周,联合国和谷歌把补救方案端上了桌:正式上线UN System Data Commons(联合国系统数据共享平台),一个开源、面向AI的数据平台,把关键全球统计数据整合成单一可检索的资源。 在这之前,联合国各机构手里的数据虽然权威,却散落在彼此隔离的孤岛里,数据分析师往往要耗费数月做繁琐的人工处理,才能真正开始分析。IT时代网微信
说人话,这个平台干三件事:
把散落在各个联合国机构、格式互相冲突的统计数据,整合成一个互相关联的"AI就绪知识图谱",用大白话就能直接检索,不用再像以前那样在老版UNdata门户里一层层翻数据库;
支持MCP(模型上下文协议),AI智能体可以直接连上来查数、查出处,还能自动把多个指标拉到一起生成图表和分析;
每个数字都记得自己从哪来,AI帮你查出来的东西,能一路追溯回最原始的联合国数据源。

进度也不含糊:已有26个联合国下属机构加入,上线时近20家的数据已经可用,目标是2027年把联合国系统80%的统计数据集都搬上来。 谷歌旗下的Google.org出了200万美元支持,平台跑在联合国自己管的实例上,以后自己维护、自己做大。雷科技
为什么联合国这么急?因为用户行为已经变了。UNICEF那个每月600多万人次访问的数据网站,今年从ChatGPT回答里点链接进来的访问量同比涨了67%,把各种AI助手都算上,大约每10次访问就有1次来自AI。 大家已经不搜网页了,大家问AI——而AI嘴里的数字,八成不靠谱。雷科技
四、你现在就能做的三件事
不用等到2027,今天就能把风险降下来。
第一,认清三类高危题。 以后问AI,碰到这三种数字先本能地警觉:①冷门长尾统计(某国小众指标、细分人群数据);②口径敏感的指标(含税不含税、汇率折算、统计年份);③时效敏感的最新数据(“今年”"上季度"开头的)。越是精确到小数点的回答,越要怀疑。
第二,用联合国的土办法自检。 Azevedo团队自己用的招你就能抄:同一问题隔两天再问一遍,或者换个模型问一遍——数字对不上,立刻作废。再进一步,让AI给出处,并且真的点开那条来源看一眼:给不出链接、链接打不开、链接里根本没有这个数的,一律按编的处理。
第三,重要数字回一手源。 写论文、发报告、做PPT给领导的数据,别让AI当二道贩子:统计类直接查UN System Data Commons、各国统计局、世行WHO这类原始库;搞技术的可以把Data Commons的MCP接口直接接进自己的AI工作流,让模型查数而不是背数。企业里做"AI问数"的,换模型之前先查口径、元数据、时效这些数据环节——很多问数偏差并不是换一个模型就能解决的,需要模型、语义、数据和权限共同治理。知乎专栏

五、谁该看、谁可以先等等
赶论文的留学生和学生党:最该紧张的一批。AI生成的数据进了论文,被查出来的定性是"伪造数据",知乎和小红书上"用AI编数据被撤学位"的求助帖不是段子。 引用必须回到一手源,AI只帮你找路,不帮你背书。小红书
做自媒体、写报告、做方案的:数字双源交叉是底线,被读者抓到一个编的数,人设就塌一半。
只是日常闲聊问AI的:不用焦虑,继续问,但别把AI随口报的数当谈资转述出去——21.2%的准确率,传谣概率比看起来高得多。
搞AI工程/数据的:UN System Data Commons的MCP支持值得今天就去试,"AI就绪数据"这个方向接下来两年会滚雪球。
最后给一个值得持续盯的信号:联合国这次把数据格式改成AI可直接调用,开了官方机构"为AI重构数据"的先河。如果世行、OECD、各国统计局跟上,AI查数这件事会从"开盲盒"慢慢变成"查字典"。但在那之前——AI给你的每个漂亮数字,都值得你多问一句:你这数,哪来的?