造引文的是AI,核引文的也是AI:三起官方实例,划清古籍AI核查的能力边界

源自176位全网作者

06:25

8月中旬,"识典古籍"上线了"深度研究助手"的"内容核查"功能:整篇稿子丢进去,AI自动把其中的引文和史实一条条挑出来核对。知乎这个由北京大学与字节跳动共建的免费古籍平台,对这项新能力的定位说得很克制——“研究助手毕竟只是辅助工具,最终意见是否需要采纳还是要看作者本人的意见”。知乎

这个功能发布的时间点,对持续关注这条线的人来说有点微妙。先看半年时间线:

  • 今年3月,有微博用户读到一篇论文引梁启超《王安石传》,觉得"说理太透彻了",循迹翻原书——书里没有,一查是AI编造的,原话是"惊了一身冷汗,幸亏没有引用"。微博

  • 4月,《自然》杂志发新闻专栏,指出AI正在"编造"根本不存在的参考文献,并且已悄然进入学术发表体系。微博 5月,arXiv出台新规:论文里出现AI幻觉(虚假引用、AI对话残留),禁投一年。微博

  • 7月,清华教授肖鹰公开质疑蒋方舟硕士论文的引注问题,"AI编造引文"成了这场来回拉扯里最热的关键词之一。微博

  • 8月,AI开始正式上岗查引文。

造假引文的是AI,现在来核引文的,也是AI。对靠写字为生的人——文史自媒体、论文学生、编辑——问题已经不是"能不能用AI查古籍",而是:AI核出来的结果能信到哪一步,哪些环节还得自己来?

一、官方放出的三个实例,值得逐条拆开

识典古籍8月15日的发布文里演示了三个案例,均为官方给出的示例;平台公开口径是累计上线4.7万余部古籍,全部免费。知乎

案例1:对文字。 一位学者发现《太平御览》引用的《华阳国志》文字与今本不同,请AI核对。AI把两处引文分清归属,在库内找到两处对应原文,判定引文与库本不一致——引文作"贡粉京师,因名粉水",库里两处均作"尝贡京师,名为粉水"——并且每条都附了可回看古籍原图的链接。知乎

案例2:对史实。 一位视频创作者做"韩僖案",讲稿写了"皇帝亲自指派,叫虔州通判周文虎再审"。AI标注存疑:库内原文是"时彬已遣通判虔州周文虎诣广西按僖罪",派遣周文虎的是江西提刑丁彬,不是高宗本人指派。主语错了,被它抓出来了。知乎

案例3:过度报警。 作者引《庚申外史》时给挑河夫补了"灰头土脸"的细节,AI判"该细节无古籍原始文本支撑"。官方自己承认:这是创作者的合理想象,AI也照样提示。知乎

三个案例恰好对应三种能力:对文字、对史实,以及——不懂语境。

造引文的是AI,核引文的也是AI:三起官方实例,划清古籍AI核查的能力边界

二、AI干的是"核对",不是"校勘"

普通用户最容易产生的误会,是把"内容核查"“知识核校"当成了"校勘"这件事本身。看机制就明白:当前这批公开工具都是"库内检索→比对→提示"的闭环。它能回答"库中有没有这句、字面是否一致”,但回答不了三个更难的问题。

第一,不一样,然后呢? 案例1里,学者所引今本《华阳国志》作"膏晖鲜芳",《太平御览》引文却作"皜曜鲜芳"。类书引文与今本有出入本是常态,孰先孰后、孰是孰非、哪里是"鲁鱼亥豕"式的形近讹字——AI只会报告"和库本不一致",但"不一致"意味着什么,仍然是人的判断。核对与校勘的分野,就在这里。

第二,库里的本子本身可靠吗? AI比对的是库内电子文本,电子文本背后是某个影印或排印本。今年上海书展上亮相的文渊阁《四库全书》AI+版,以上海古籍出版社2012年影印本为基础,收3400余种、79000余卷、8亿余字;现场工作人员的介绍里就有一句很诚实的提示:找到内容右键引用之后,“如果觉得不够保险,还可以回到原文再校对一遍”。光明日报 B站8月也有创作者专门做视频讨论"给AI加上古籍约束"会不会更准,结论同样直接:约束能让回答更聚焦,但保证不了引证材料本身为真。哔哩哔哩

第三,库里没有怎么办? 云四库(浙江大学数字人文研究中心打造的古籍问答系统)被知乎用户测评后提醒了一句:“冷门版本检索精度还需自己验证”。知乎 而在"古籍数字化、AI辅助校勘,会让传统古籍研究者的核心能力被替代吗"的知乎问题下,回答者的总结只有一行:AI可以帮助解决句读,剩下的还得人来。知乎

一句话:AI核查能防"引错书、写错字"这两步,防不了"选错本"那一步。

造引文的是AI,核引文的也是AI:三起官方实例,划清古籍AI核查的能力边界

三、同期工具盘点:哪一件、给谁用、干什么用

把8月同期露面的"核查向"工具按发布口径放进一张表(规模与功能描述均出自官方或媒体原文):

工具

背景

库/卖点

费用状态

适合谁

识典古籍·内容核查

北大×字节跳动

4.7万部在库;整篇核查、史实抽取溯源、可回看原书

免费

文字/视频创作者核稿子引文

四库全书AI+版

上海古籍出版社

文渊阁影印本为基础,3400余种/79000余卷/8亿余字,右键引用、可对标点译文追问

书展亮相

做四库系文本大范围检索的人

聚典写作助手

上海世纪出版集团展出品

知识核校、文稿审校,强调"答案从哪里来"

新品

编辑、写作者

云四库

浙大数字人文研究中心

超420亿字文史训练数据(自述),每答有文献溯源

每日免费问答次数,多所高校与图书馆试用

查引文出处的学生

世纪墨池

上海世纪出版集团自研

16个智能体含"审稿校对",称核心环节综合提效超80%

内部平台

仅作出版业风向参考

两个圈内观察。

一是话术都只说半句。真正可信的,是这些产品共同承认的那个弱点——四库AI+版让你"回到原文再校对一遍";识典古籍发布文写"研究助手毕竟只是辅助工具";上海世纪出版集团的自研平台虽然给出"16个智能体各司其职,核心生产环节综合效率提升超过80%"的数字,但它的口径是提效,不是担保。光明日报

二是真正拉开差距的是库和本子。识典古籍的核查强在可回链到古籍原图;四库AI+版的底座是上古影印本;云四库靠浙大的文史语料。同一句引文,不同工具可能给出不同的"原文"——这在文献学里本来就有现成的说法:各本不同。

造引文的是AI,核引文的也是AI:三起官方实例,划清古籍AI核查的能力边界

四、结论:三类人分开说,附一套能抄的三步法

文史自媒体/视频创作者:值得用,而且优先用在对史实上——"韩僖案"那种主语张冠李戴,是创作者最常犯、也最不想在评论区被当众抓出来的错。用法是把整篇稿子过一遍当第一道筛;但AI标"存疑"不必照单全改(灰头土脸就是合理补充),判"可信"也别高枕无忧。最关键的20%引文(钩子、立论支点),点开回链看一次原图,逐字过。

论文学生:AI找位置,引用回到你手上的整理本。AI告诉你的是"库里有没有这句",论文要的是"这句出自什么版本、哪一卷哪一页"。arXiv已经把虚假引用写进了处罚条款,中文学术圈的规范只会收紧,引文不存在的成本只会变高。

进阶爱好者(简帛、敦煌、民间校勘党):这批公开工具暂时不服务你们。冷门写本不在库里,“查无此句"不等于你们关心的那个"查无”;工具省的是查通行本、断句读这两步的力气,版本比对和取舍底本,还是人肉活。

三步SOP,可以直接抄:

  1. :整篇过AI核查,拿到"可信/存疑/不一致"三档结果;

  2. :重要引文点回链看原书图,顺手确认所用文本的底本来源;

  3. :对"不一致"处连问三个问题——异文?讹字?还是AI没找到?答不上来就写"存疑",别硬下结论。

接下来值得盯的信号:核查工具会不会开放多库比对(而不是只对一个库)、四库AI+版会不会公开校勘记全文、云四库试用机构会不会扩大。小红书近一周的数字人文选题讨论里,"古籍智能校勘"已经被排进了方向清单的第一条,需求是真的,供给才刚起步。小红书 等AI对账的那个库从"影印本"换成"校勘本"的那天,"AI校勘"才配得上"校勘"两个字。

现在这阵子,AI干的是校勘里最机械的那部分活。这个免费劳力值得用,但别把它当老师。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章