上周刷微博的朋友,大概率刷到过 #AI焚书# 这个话题。
简单说就是:美国AI公司花数千万美元,从全球二手书商手里批量收购旧书,切掉书脊、高速扫描成数据喂给大模型,最后把纸书直接粉碎回收。
很多人当硅谷奇闻看完就划走了。但我把几个信源对完之后发现,这事对读古籍、买旧书的人来说,值得认真看一遍——不是因为网传的"中华孤本被烧了"(这个说法目前没有实证),而是因为真正的风险射程,比大多数人以为的离古籍圈更近。
今天把这件事从头捋一遍,回答古籍圈最关心的三个问题:到底发生了什么、哪些书真的危险、我们能做什么。
一、不是个别公司发疯,是一条工业化流水线
事情的暴露很有戏剧性。今年4月底开始,欧美多国的二手书商陆续发现异常订单:买家只按ISBN清单下单,不问品相、不砍价、全部预付,一本卖5欧元的书,运费40欧元也照付。德国书商菲利普·韦伯在行业论坛发帖问"这是不是欺诈",跟帖盖了17页;荷兰古籍书店De Vries & De Vries则收到一家自称"2077AI"的新加坡公司邮件,一口气要采购近3000本书。这些订单有个共同点:全是"质量很好但主题小众、多年无人问津"的冷门书。知乎
7月底真相水落石出:订单背后是AI公司的训练语料采购。其中动作最大的是Anthropic,内部代号"巴拿马计划",2024年初启动,还专门从谷歌图书项目挖了前负责人操盘。内部文件写得很直白:“代表了我们破坏性扫描世界上所有书籍的努力”,还附了一句"我们不希望外界知道我们在做这件事"。知乎
流程已经高度工业化:从大型二手书商批量采购2022年之前出版的纸质书,运到仓库后用液压设备切掉书脊,散页送进高速扫描仪,每分钟能过80到120页,扫完纸书送进碎纸机或回收渠道。供应商方案里写的处理量是六个月50万到200万册。知乎
7月20日,加州北区联邦法院最终批准了Anthropic与作家群体的和解协议:为使用盗版电子书训练模型支付15亿美元,覆盖约48万部作品,折合每部约3000美元——这是美国版权史上规模最大的版权和解。微博知乎但注意一个关键区分:这15亿赔的是盗版电子书,而"买断实体书再粉碎"这条线,在美国现行法律下目前被认定为合法。

7月27日,马斯克在X上表态,要求旗下AI团队把珍稀书籍保存在图书馆、用非破坏性方式扫描。微博这算是行业内第一个公开唱反调的。但产业链上的中间商ISBNdb(收录超1.11亿本书的元数据平台,替AI公司匿名批量采购还提供保密协议)被曝光后虽然删过页面,很快又恢复上线,甚至拿法院判决给自己背书,继续做生意。
二、两个反常识:为什么抢纸质书,为什么销毁反而"更合法"
第一个反常识:AI公司为什么放着网上免费的文字不要,花大价钱买纸书?
因为互联网已经被AI自己污染了。斯坦福2026年AI指数报告的数据是:新发布互联网内容中AI生成的比例已超过51%。知乎模型用AI生成的内容继续训练,会发生"模型塌缩",越训越歪。牛津、剑桥等机构的联合研究2024年7月登上《自然》封面,证明只要训练数据被污染,塌缩在数学上不可避免。Epoch AI的测算更扎心:人类公开的高质量文本数据,预计2026到2032年间就会被耗尽。相关讨论里流传着一张图:机器人在图书馆里烧旧书,画面很反乌托邦,但说的正是这层逻辑——2022年之前印刷的纸质书,成了物理上不可能含有AI生成内容的最后一片净土。微博

ISBNdb的宣传语就是:“世界上最好的AI训练数据,正摆在书架上”。知乎
第二个反常识更扎心:销毁原件,在法庭上反而更有利。2025年6月的Bartz诉Anthropic案中,法官的裁定逻辑是:书是合法买来的(首次销售原则,买家有权处置),扫描成数字版用于训练属于"转化性合理使用",数字副本又不对外再分发——三个条件一凑,粉碎原书不构成侵权,反而能用来主张"节省存储空间"。知乎换句话说,版权法管得了"偷",管不了"买光再拆"。
这也解释了为什么销毁必须销毁:留着原件,反而可能给诉讼留把柄。
三、中华古籍会被烧吗?先辟谣,再看真正的风险区
先说结论里辟谣的部分:微博上流传的"大量流失海外的中华孤本、地方志正在被永久销毁",目前没有找到直接证据。微博宋元孤本、明清善本这些真正的顶级善本,绝大多数藏在各国公藏机构(国图、各地图书馆、日本内阁文库等),不进入二手市场流通,AI公司想买也买不到。今年7月刚有两册《永乐大典》"湖"字册、"丧"字册入藏杭州国家版本馆。新华网这类国宝级典籍的回归和典藏,走的都是公对公的通道。

但真正的风险区,是一类特别容易被忽略的书:冷门、绝版、低流通的纸本文献——这恰恰是书商们描述的扫货目标的原话画像。而海外汉籍系统里,存量最大的偏偏就是这一类:晚清刻本、民国铅印本、地方志抄本、传教士汉语文献、早期学报期刊。那位美国稀有书商在采访里说得很直白:“我的库房里有很多来自海外和外语的书籍,的确很适合做这种生意”。知乎
更值得警惕的是后果的不可逆性。当年谷歌图书项目做大规模数字化,至少保留了实体原件、向公众开放检索和片段浏览;"巴拿马计划"则是全程保密,数字副本仅供内部使用,永不公开。一本书被粉碎后,世界上就只剩一家公司内部的那份扫描件——版本对校做不了,原书的批校、藏印、纸墨信息全部归零。版权赔得起钱,书脊切了就真没了。
四、读古籍的人,能做的三件事
与其转发愤怒,不如把下面这些事做了。
第一,把国内数字古籍资源用起来,这是最硬的底气。
国家图书馆"中华古籍资源库":目前国内公开规模最大的数字古籍影像资源库,免费使用,地方志和医书类尤其丰富;
中华书局"中国经典古籍库"、爱如生"中国基本古籍库":专业整理本数据库,后者2026年3月起开放了免费访问渠道;
中国哲学书电子化计划(ctext.org):先秦两汉文献检索利器;字节的"识典古籍"App则适合移动阅读和AI辅助校对;
查版本源流:中国古籍保护网(全国古籍联合目录)、上海图书馆中文古籍联合目录。
这些资源存在的意义,就是在物理原件出问题时,内容和对校基础还在我们自己手里。
第二,重新评估手里和市面上"不起眼的旧书"。 过去觉得"不值几个钱"的晚清刻本、民国铅印本、地方志,在全球扫货的背景下多了一层稀缺属性:它们正是批量采购最爱的品类。旧书摊遇到品相完整的冷门旧书,别当废纸论价;自己收藏的,做好避光防潮,扫描留档时尽量保留彩色影像和书脊、藏印细节——这些是数字副本替代不了的信息。

第三,盯住三个信号。 一是美国国会正在推进的AI版权立法;二是Hachette诉Google Gemini、Kadrey诉Meta等在审案件的判决走向;三是ISBNdb这类中间商的采购动向——如果未来国内二手市场出现对中文旧书的异常批量收购,那才是真正需要圈内大声喊出来的时刻。
写在最后
古人传书,靠抄写、刻印、影抄、缩微胶卷,一代代把纸传下去。今天这场"焚书"不点火,它留下数据、毁掉纸。
作为普通读古籍的人,我们改变不了大洋彼岸的判决,但能决定书在自己手里怎么活:多用一次数字资源,就多一个人见过它的内容;多留一本冷门旧书,世界上就少一个孤本。古籍最怕的从来不是被骂、被争议,而是没人再翻开它。