当前位置:
AIGC文章详情

AI公司花数千万美元“买书焚书”:海外中华古籍在射程之内,但先别急着愤怒

源自28位全网作者

18:54

上周刷微博的朋友,大概率刷到过 #AI焚书# 这个话题。

简单说就是:美国AI公司花数千万美元,从全球二手书商手里批量收购旧书,切掉书脊、高速扫描成数据喂给大模型,最后把纸书直接粉碎回收。

很多人当硅谷奇闻看完就划走了。但我把几个信源对完之后发现,这事对读古籍、买旧书的人来说,值得认真看一遍——不是因为网传的"中华孤本被烧了"(这个说法目前没有实证),而是因为真正的风险射程,比大多数人以为的离古籍圈更近。

今天把这件事从头捋一遍,回答古籍圈最关心的三个问题:到底发生了什么、哪些书真的危险、我们能做什么。

一、不是个别公司发疯,是一条工业化流水线

事情的暴露很有戏剧性。今年4月底开始,欧美多国的二手书商陆续发现异常订单:买家只按ISBN清单下单,不问品相、不砍价、全部预付,一本卖5欧元的书,运费40欧元也照付。德国书商菲利普·韦伯在行业论坛发帖问"这是不是欺诈",跟帖盖了17页;荷兰古籍书店De Vries & De Vries则收到一家自称"2077AI"的新加坡公司邮件,一口气要采购近3000本书。这些订单有个共同点:全是"质量很好但主题小众、多年无人问津"的冷门书。知乎

7月底真相水落石出:订单背后是AI公司的训练语料采购。其中动作最大的是Anthropic,内部代号"巴拿马计划",2024年初启动,还专门从谷歌图书项目挖了前负责人操盘。内部文件写得很直白:“代表了我们破坏性扫描世界上所有书籍的努力”,还附了一句"我们不希望外界知道我们在做这件事"。知乎

流程已经高度工业化:从大型二手书商批量采购2022年之前出版的纸质书,运到仓库后用液压设备切掉书脊,散页送进高速扫描仪,每分钟能过80到120页,扫完纸书送进碎纸机或回收渠道。供应商方案里写的处理量是六个月50万到200万册。知乎

7月20日,加州北区联邦法院最终批准了Anthropic与作家群体的和解协议:为使用盗版电子书训练模型支付15亿美元,覆盖约48万部作品,折合每部约3000美元——这是美国版权史上规模最大的版权和解。微博知乎但注意一个关键区分:这15亿赔的是盗版电子书,而"买断实体书再粉碎"这条线,在美国现行法律下目前被认定为合法。

AI公司花数千万美元“买书焚书”:海外中华古籍在射程之内,但先别急着愤怒

7月27日,马斯克在X上表态,要求旗下AI团队把珍稀书籍保存在图书馆、用非破坏性方式扫描。微博这算是行业内第一个公开唱反调的。但产业链上的中间商ISBNdb(收录超1.11亿本书的元数据平台,替AI公司匿名批量采购还提供保密协议)被曝光后虽然删过页面,很快又恢复上线,甚至拿法院判决给自己背书,继续做生意。

二、两个反常识:为什么抢纸质书,为什么销毁反而"更合法"

第一个反常识:AI公司为什么放着网上免费的文字不要,花大价钱买纸书?

因为互联网已经被AI自己污染了。斯坦福2026年AI指数报告的数据是:新发布互联网内容中AI生成的比例已超过51%。知乎模型用AI生成的内容继续训练,会发生"模型塌缩",越训越歪。牛津、剑桥等机构的联合研究2024年7月登上《自然》封面,证明只要训练数据被污染,塌缩在数学上不可避免。Epoch AI的测算更扎心:人类公开的高质量文本数据,预计2026到2032年间就会被耗尽。相关讨论里流传着一张图:机器人在图书馆里烧旧书,画面很反乌托邦,但说的正是这层逻辑——2022年之前印刷的纸质书,成了物理上不可能含有AI生成内容的最后一片净土。微博

AI公司花数千万美元“买书焚书”:海外中华古籍在射程之内,但先别急着愤怒

ISBNdb的宣传语就是:“世界上最好的AI训练数据,正摆在书架上”。知乎

第二个反常识更扎心:销毁原件,在法庭上反而更有利。2025年6月的Bartz诉Anthropic案中,法官的裁定逻辑是:书是合法买来的(首次销售原则,买家有权处置),扫描成数字版用于训练属于"转化性合理使用",数字副本又不对外再分发——三个条件一凑,粉碎原书不构成侵权,反而能用来主张"节省存储空间"。知乎换句话说,版权法管得了"偷",管不了"买光再拆"。

这也解释了为什么销毁必须销毁:留着原件,反而可能给诉讼留把柄。

三、中华古籍会被烧吗?先辟谣,再看真正的风险区

先说结论里辟谣的部分:微博上流传的"大量流失海外的中华孤本、地方志正在被永久销毁",目前没有找到直接证据。微博宋元孤本、明清善本这些真正的顶级善本,绝大多数藏在各国公藏机构(国图、各地图书馆、日本内阁文库等),不进入二手市场流通,AI公司想买也买不到。今年7月刚有两册《永乐大典》"湖"字册、"丧"字册入藏杭州国家版本馆。新华网这类国宝级典籍的回归和典藏,走的都是公对公的通道。

AI公司花数千万美元“买书焚书”:海外中华古籍在射程之内,但先别急着愤怒

但真正的风险区,是一类特别容易被忽略的书:冷门、绝版、低流通的纸本文献——这恰恰是书商们描述的扫货目标的原话画像。而海外汉籍系统里,存量最大的偏偏就是这一类:晚清刻本、民国铅印本、地方志抄本、传教士汉语文献、早期学报期刊。那位美国稀有书商在采访里说得很直白:“我的库房里有很多来自海外和外语的书籍,的确很适合做这种生意”。知乎

更值得警惕的是后果的不可逆性。当年谷歌图书项目做大规模数字化,至少保留了实体原件、向公众开放检索和片段浏览;"巴拿马计划"则是全程保密,数字副本仅供内部使用,永不公开。一本书被粉碎后,世界上就只剩一家公司内部的那份扫描件——版本对校做不了,原书的批校、藏印、纸墨信息全部归零。版权赔得起钱,书脊切了就真没了。

四、读古籍的人,能做的三件事

与其转发愤怒,不如把下面这些事做了。

第一,把国内数字古籍资源用起来,这是最硬的底气。

  • 国家图书馆"中华古籍资源库":目前国内公开规模最大的数字古籍影像资源库,免费使用,地方志和医书类尤其丰富;

  • 中华书局"中国经典古籍库"、爱如生"中国基本古籍库":专业整理本数据库,后者2026年3月起开放了免费访问渠道;

  • 中国哲学书电子化计划(ctext.org):先秦两汉文献检索利器;字节的"识典古籍"App则适合移动阅读和AI辅助校对;

  • 查版本源流:中国古籍保护网(全国古籍联合目录)、上海图书馆中文古籍联合目录。

这些资源存在的意义,就是在物理原件出问题时,内容和对校基础还在我们自己手里。

第二,重新评估手里和市面上"不起眼的旧书"。 过去觉得"不值几个钱"的晚清刻本、民国铅印本、地方志,在全球扫货的背景下多了一层稀缺属性:它们正是批量采购最爱的品类。旧书摊遇到品相完整的冷门旧书,别当废纸论价;自己收藏的,做好避光防潮,扫描留档时尽量保留彩色影像和书脊、藏印细节——这些是数字副本替代不了的信息。

AI公司花数千万美元“买书焚书”:海外中华古籍在射程之内,但先别急着愤怒

第三,盯住三个信号。 一是美国国会正在推进的AI版权立法;二是Hachette诉Google Gemini、Kadrey诉Meta等在审案件的判决走向;三是ISBNdb这类中间商的采购动向——如果未来国内二手市场出现对中文旧书的异常批量收购,那才是真正需要圈内大声喊出来的时刻。

写在最后

古人传书,靠抄写、刻印、影抄、缩微胶卷,一代代把纸传下去。今天这场"焚书"不点火,它留下数据、毁掉纸。

作为普通读古籍的人,我们改变不了大洋彼岸的判决,但能决定书在自己手里怎么活:多用一次数字资源,就多一个人见过它的内容;多留一本冷门旧书,世界上就少一个孤本。古籍最怕的从来不是被骂、被争议,而是没人再翻开它。

内容由AI生成

精选参考来源

1. 数千万美元买书、15亿和解金“赎身”:Anthropic的“焚书”生意经

2. 抢完互联网数据,AI公司开始抢绝版纸质书

3. #Anthropic为训练模型焚书坑儒#当代版“焚书坑儒”的判决出来了,拉扯了快两年的Anthropic盗版书训练集体诉讼案,终于结束了。法院最终批准,Anthropic向原告支付15亿美元的天价和解金。而Anthropic前两年的实际营收,也只有50亿。这一刀,快砍到大动脉了。#AI焚书#还是先简单介绍下前情。很...全文

4. #马斯克都看不下去了#【#马斯克反对AI公司破坏性扫描书籍#】当地时间7月27日,美国企业家埃隆·马斯克在社交平台X发文表示,他已要求旗下的人工智能(AI)公司SpaceXAI将处理过的珍稀书籍保存在一个图书馆,并以不损坏书籍的方式扫描,而不是直接切断书脊后扫描。马斯克的此番表态针对的是另一家美国A...全文

5. #AI焚书#2022年后,估计连AI从业人员都不好区分,哪些书籍是人类创作,哪些书籍是AI创作。所以目前,AI公司为了拿到“干净”的训练数据,只买2022年之前出版的人类书籍,把买来的实体书拆了扫描,然后销毁,俗称“AI焚书”。目前从法律层面来看,买正版书扫描,合法,下载盗版书来训练,违法。尽管...全文

6. #AI公司为训练模型销毁原版书籍##AI焚书#终于知道为什么历史不等人了,美国AI企业批量买断绝版古籍,扫描完直接粉碎原书。大量流失海外的中华孤本、地方志正在这个过程里永久消失。现在纸质原件全部销毁,唯一史料握在海外资本手里。想修改、遮蔽任何历史内容,没有实物能戳穿谎言。百万册中华...全文

7. 文明探源丨六百年永乐大典:墨色深沉 朱线灿然

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章