AI公司满世界收旧书,一场静悄悄的"焚书"
今年春夏之交,德国莱比锡几家旧书店的老板觉得有点不对劲。
每天差不多固定时间,系统就跳出一批订单,买家是家叫 Zoombooks 的加拿大公司。不买热门小说,不追初版签名本,专挑那些积灰多年的普通旧书。七十年代以后出版、带ISBN编号、非虚构类为主。烹饪书、民间故事、不出名的游记,通通要。
订单稳定得像台机器设好的程序。几位老板一交流,发现不是自己一家。从德国到西班牙,从澳大利亚到新西兰,全世界的旧书商都遇到了同样的采购模式。
很快有人猜到了:这些书不是拿去卖的,是拿去喂AI的。
到底在干什么
2026年初,超过4000页法庭文件在美国联邦法院解封,一个代号为"巴拿马项目"的秘密计划被完整曝光。
主角是Anthropic,就是做Claude模型那家,估值一度超过1800亿美元。
图片操作流程简单粗暴:买书、切掉书脊、高速扫描、销毁纸张。
液压切割机把书脊整齐切掉,散开的书页送进工业级扫描仪转成高清PDF,然后纸质残骸直接送回收公司。不保留任何实体副本。
Anthropic花了数千万美元,从Better World Books、World of Books这些二手书零售商批量拿货,每次动辄数万册。内部文件还讨论过接洽纽约公共图书馆。负责这个项目的高管Tom Turvey,是从谷歌图书项目挖来的,二十年前他参与过谷歌扫描全世界书的计划。
一份2024年的内部计划文件写得直白:"Project Panama是我们破坏性扫描全世界所有书的计划。""我们不希望被人知道我们在做这件事。"
他们显然知道大家会怎么反应。
一家"负责任"的公司
多说两句Anthropic。
这家公司2021年从OpenAI分裂出来,创始人是Dario Amodei兄妹,出走的原因是觉得OpenAI在安全上不够上心。品牌定位就一句话:我们是负责任的那家。
搞了"Constitutional AI"框架,通俗讲就是给AI定一部"宪法",让它自我约束。招了一大批前政府官员做政策合规,拿了谷歌、亚马逊几十亿美金投资。Dario去年还写了篇万字长文,畅想AI怎么治癌症、灭贫困、救气候。翻来覆去就一个调调:我们在做对全人类有益的事,放心把未来交给我们。
然后他们把全人类的书买来,切碎了。
为什么要买纸质书
都什么年代了,电子书不是一大堆?
问题恰恰出在这。网上的内容已经被AI自己生成的东西污染了。模型用AI产出的垃圾训练自己,越学越蠢,这叫"模型崩溃"。2022年以前出版的纸质书,那时候互联网还没被AI内容淹没,每一行字都是人写的,是干净的高质量文本。
数字资源基本被薅干了。维基百科、论坛、博客、新闻网站,该烤的早就烤进模型里了。要继续提升模型能力,需要经过编辑、有结构的系统知识。这些东西大量躺在纸质书和专业文献里。
Anthropic的律师团队在法庭上提了双重辩护。一是"首次销售原则":我合法买了一本书,想怎么处置都行。二是"合理使用":扫描件只用于内部训练,不对外分发,销毁原件反而确保不会产生新的版权副本流入市场。
法官倾向于认可这套逻辑。2025年6月,联邦法官William Alsup裁定:合法购买实体书、破坏性扫描、训练AI,属于合理使用。他在裁定书里写道:"每一本被购买的实体书都被复制成了数字副本,实体原件被销毁了。一个取代了另一个。"
真正让Anthropic赔钱的不是买书,而是更早之前的盗版。
图片15亿美元的学费
在"巴拿马项目"之前,Anthropic走的是更简单粗暴的路:直接从盗版网站下载。
联合创始人Ben Mann在2021年6月,11天内从LibGen下载了大量书籍。后来又从另一个盗版网站Pirate Library Mirror搞了约200万本。他当时把链接发给同事,附了一句:"来得正是时候!!!"
法院查明:从LibGen累计下载约500万本盗版书,从Pirate Library Mirror约200万本。CEO Dario Amodei在内部把付钱给作者称为"legal/practice/business slog"。翻译一下就是嫌麻烦。
2025年9月,Anthropic与作家集体诉讼达成和解,赔偿15亿美元。每部侵权作品折合约3000美元,受影响书籍约50万本。这个数字是版权法历史上最大的和解金。
讽刺的是:切书在法律上没问题,伸手进盗版图书馆才是。
不止一家
Anthropic只是被曝光得最彻底的那个。
ISBNdb,一个收录超1.11亿本书目信息的数据库平台,现在专门给AI企业做大规模图书采购服务。单笔订单从1000本到100万本不等。它的广告语是:"世界上最好的AI训练数据就在书架上"。2022年前出版的纸质书,因为没被AI内容污染,被精准定位为"纯净数据"。
书商们感受到了变化。有书商透露,今年4月以来生意反常地好。过去旺季一周才卖20本左右,近几个月每周能卖几百本,翻了大约五倍。采购对象几乎全是带ISBN编号的书,小说、教材、专业书通吃,毫无主题偏好。买家对价格也出奇大方,高于市价也照单全收。有书商说心情复杂:"财务上确实受益,但我不喜欢这些书的最终去处,也不喜欢那些不常见的书被粉碎。"
谷歌也被出版商联盟起诉,指控它未经授权用数百万本受版权保护的书训练Gemini。OpenAI、Meta也深陷类似官司。
书的命运
德国媒体和旧书行业流露出的情绪,重点不是版权,是惋惜书本身。
在不少欧洲书商看来,一本旧书的终点不是卖出那一刻。它被第一个读者读完,并没有结束生命。它还会再进入旧书店、图书馆、私人书架,在流通中不断建立新的联系。
现在,这些书被买走、切开、扫描、碾碎。知识变成了模型参数,纸变成了回收浆。稀有书、绝版书、外文小语种书,没有电子版,全球就剩几百本。它们被扫描进AI公司的私有数据库,外界看不到,作者看不到,公众也看不到。这些内容唯一的作用是让模型变聪明,然后按API收费。
有人把这事和科幻作家弗诺·文奇20年前的小说《彩虹尽头》做对比。小说里描写的就是图书馆被拆解数字化的场景。20年后,小说成了新闻。
知识是谁的
扯一个根本性的问题:这些书到底属于谁?
每一本书背后,都是一个人或一群人花了大把时间想明白的事。几十年的阅历,几年的打磨,最后变成几百页纸。人类几千年攒下来的思想,大部分就躺在这里面。哲学、历史、民间故事、绝版的植物图鉴、不出名的游记。
这些东西不是哪个人或哪家公司的私产。一本三百年前的书,它属于所有还愿意翻开它的人。你在图书馆发现它,在旧书店淘到它,在某个下午读到一句让你愣住的话。这就是知识活着的样子。流通、传承、被翻到烂。
现在一家公司走过来,买走、拆开、扫描、碾碎。知识变成他们数据库里的参数,纸变成回收浆。然后律师说:这叫合理使用。
书被数字化之后,它就不在公共领域了。它变成某家公司的训练数据,锁在服务器里,你再也碰不到。你以为知识被保存了,其实被圈起来了。
保存知识?圈起来不让碰,那叫圈占。
马斯克说:我们不一样
7月27日,马斯克在X上转发了404 Media的这篇报道,附了一句话:"我已要求SpaceXAI团队把珍稀图书保存在图书馆里,用笨办法扫描,而不是直接切掉书脊。"
图片非破坏性扫描用俯拍扫描仪、平板扫描仪或V型扫描架,不拆书,不伤装帧,扫完书还是完整的。就是慢,就是贵。破坏性扫描一天能处理几千本,非破坏性可能只有几十本。
马斯克等于在模式选择上割了自己一刀。花更多钱、花更多时间,换书一条命。
有人回复说:"虽然慢,但你们还是能拿到训练数据。如果SpaceXAI能做到,其他公司也应该照这个标准来。"话是漂亮。但整个行业都在追求效率,Anthropic切书脊就是因为快、因为便宜。马斯克说"我们不一样",到底是真心疼书,还是借机踩竞争对手一脚,各人有各人的判断。
当AI行业默认的流程就是买完就切碎,有人站出来说"我不这么干",这事本身就说明大家已经受够了。
一本书放在书架上,不需要电、不需要网络、不需要订阅,可以保存500年。而它被销毁去喂养的那个AI模型,18个月后就会被扔进垃圾桶,被下一代取代。
Anthropic花了15亿美元的学费想明白一件事:从偷到买,买了、扫了、毁了,法律上反而站得住脚。这笔账,他们算得很清楚。
只是那些被切碎的书,再也拼不回来了。
更糟的是,AI 能改书。物理销毁至少诚实。书没了就是没了。但如果未来的某天,你翻开一本经典,里面的内容已经被模型"优化"过一遍,你读到的是原著还是改写版?切书有灰烬,数字篡改连证据都不会留。到时候,连"什么是原版"都没人说得清了。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
