AI公司满世界收旧书,一场静悄悄的"焚书"
今年春夏之交,德国莱比锡几家旧书店的老板觉得有点不对劲。
每天差不多固定时间,系统就跳出一批订单,买家是家叫 Zoombooks 的加拿大公司。不买热门小说,不追初版签名本,专挑那些积灰多年的普通旧书。七十年代以后出版、带ISBN编号、非虚构类为主。烹饪书、民间故事、不出名的游记,通通要。
订单稳定得像台机器设好的程序。几位老板一交流,发现不是自己一家。从德国到西班牙,从澳大利亚到新西兰,全世界的旧书商都遇到了同样的采购模式。
很快有人猜到了:这些书不是拿去卖的,是拿去喂AI的。
到底在干什么
2026年初,超过4000页法庭文件在美国联邦法院解封,一个代号为"巴拿马项目"的秘密计划被完整曝光。
主角是Anthropic,就是做Claude模型那家,估值一度超过1800亿美元。
图片操作流程简单粗暴:买书、切掉书脊、高速扫描、销毁纸张。
液压切割机把书脊整齐切掉,散开的书页送进工业级扫描仪转成高清PDF,然后纸质残骸直接送回收公司。不保留任何实体副本。
Anthropic花了数千万美元,从Better World Books、World of Books这些二手书零售商批量拿货,每次动辄数万册。内部文件还讨论过接洽纽约公共图书馆。负责这个项目的高管Tom Turvey,是从谷歌图书项目挖来的,二十年前他参与过谷歌扫描全世界书的计划。
一份2024年的内部计划文件写得直白:"Project Panama是我们破坏性扫描全世界所有书的计划。""我们不希望被人知道我们在做这件事。"
他们显然知道大家会怎么反应。
一家"负责任"的公司
多说两句Anthropic。
这家公司2021年从OpenAI分裂出来,创始人是Dario Amodei兄妹,出走的原因是觉得OpenAI在安全上不够上心。品牌定位就一句话:我们是负责任的那家。
搞了"Constitutional AI"框架,通俗讲就是给AI定一部"宪法",让它自我约束。招了一大批前政府官员做政策合规,拿了谷歌、亚马逊几十亿美金投资。Dario去年还写了篇万字长文,畅想AI怎么治癌症、灭贫困、救气候。翻来覆去就一个调调:我们在做对全人类有益的事,放心把未来交给我们。
然后他们把全人类的书买来,切碎了。
为什么要买纸质书
都什么年代了,电子书不是一大堆?
问题恰恰出在这。网上的内容已经被AI自己生成的东西污染了。模型用AI产出的垃圾训练自己,越学越蠢,这叫"模型崩溃"。2022年以前出版的纸质书,那时候互联网还没被AI内容淹没,每一行字都是人写的,是干净的高质量文本。
数字资源基本被薅干了。维基百科、论坛、博客、新闻网站,该烤的早就烤进模型里了。要继续提升模型能力,需要经过编辑、有结构的系统知识。这些东西大量躺在纸质书和专业文献里。
Anthropic的律师团队在法庭上提了双重辩护。一是"首次销售原则":我合法买了一本书,想怎么处置都行。二是"合理使用":扫描件只用于内部训练,不对外分发,销毁原件反而确保不会产生新的版权副本流入市场。
法官倾向于认可这套逻辑。2025年6月,联邦法官William Alsup裁定:合法购买实体书、破坏性扫描、训练AI,属于合理使用。他在裁定书里写道:"每一本被购买的实体书都被复制成了数字副本,实体原件被销毁了。一个取代了另一个。"
真正让Anthropic赔钱的不是买书,而是更早之前的盗版。
图片15亿美元的学费
在"巴拿马项目"之前,Anthropic走的是更简单粗暴的路:直接从盗版网站下载。
联合创始人Ben Mann在2021年6月,11天内从LibGen下载了大量书籍。后来又从另一个盗版网站Pirate Library Mirror搞了约200万本。他当时把链接发给同事,附了一句:"来得正是时候!!!"
法院查明:从LibGen累计下载约500万本盗版书,从Pirate Library Mirror约200万本。CEO Dario Amodei在内部把付钱给作者称为"legal/practice/business slog"。翻译一下就是嫌麻烦。
2025年9月,Anthropic与作家集体诉讼达成和解,赔偿15亿美元。每部侵权作品折合约3000美元,受影响书籍约50万本。这个数字是版权法历史上最大的和解金。
讽刺的是:切书在法律上没问题,伸手进盗版图书馆才是。
不止一家
Anthropic只是被曝光得最彻底的那个。
ISBNdb,一个收录超1.11亿本书目信息的数据库平台,现在专门给AI企业做大规模图书采购服务。单笔订单从1000本到100万本不等。它的广告语是:"世界上最好的AI训练数据就在书架上"。2022年前出版的纸质书,因为没被AI内容污染,被精准定位为"纯净数据"。
书商们感受到了变化。有书商透露,今年4月以来生意反常地好。过去旺季一周才卖20本左右,近几个月每周能卖几百本,翻了大约五倍。采购对象几乎全是带ISBN编号的书,小说、教材、专业书通吃,毫无主题偏好。买家对价格也出奇大方,高于市价也照单全收。有书商说心情复杂:"财务上确实受益,但我不喜欢这些书的最终去处,也不喜欢那些不常见的书被粉碎。"
谷歌也被出版商联盟起诉,指控它未经授权用数百万本受版权保护的书训练Gemini。OpenAI、Meta也深陷类似官司。
书的命运
德国媒体和旧书行业流露出的情绪,重点不是版权,是惋惜书本身。
在不少欧洲书商看来,一本旧书的终点不是卖出那一刻。它被第一个读者读完,并没有结束生命。它还会再进入旧书店、图书馆、私人书架,在流通中不断建立新的联系。
现在,这些书被买走、切开、扫描、碾碎。知识变成了模型参数,纸变成了回收浆。稀有书、绝版书、外文小语种书,没有电子版,全球就剩几百本。它们被扫描进AI公司的私有数据库,外界看不到,作者看不到,公众也看不到。这些内容唯一的作用是让模型变聪明,然后按API收费。
有人把这事和科幻作家弗诺·文奇20年前的小说《彩虹尽头》做对比。小说里描写的就是图书馆被拆解数字化的场景。20年后,小说成了新闻。
知识是谁的
扯一个根本性的问题:这些书到底属于谁?
每一本书背后,都是一个人或一群人花了大把时间想明白的事。几十年的阅历,几年的打磨,最后变成几百页纸。人类几千年攒下来的思想,大部分就躺在这里面。哲学、历史、民间故事、绝版的植物图鉴、不出名的游记。
这些东西不是哪个人或哪家公司的私产。一本三百年前的书,它属于所有还愿意翻开它的人。你在图书馆发现它,在旧书店淘到它,在某个下午读到一句让你愣住的话。这就是知识活着的样子。流通、传承、被翻到烂。
现在一家公司走过来,买走、拆开、扫描、碾碎。知识变成他们数据库里的参数,纸变成回收浆。然后律师说:这叫合理使用。
书被数字化之后,它就不在公共领域了。它变成某家公司的训练数据,锁在服务器里,你再也碰不到。你以为知识被保存了,其实被圈起来了。
保存知识?圈起来不让碰,那叫圈占。
马斯克说:我们不一样
7月27日,马斯克在X上转发了404 Media的这篇报道,附了一句话:"我已要求SpaceXAI团队把珍稀图书保存在图书馆里,用笨办法扫描,而不是直接切掉书脊。"
图片非破坏性扫描用俯拍扫描仪、平板扫描仪或V型扫描架,不拆书,不伤装帧,扫完书还是完整的。就是慢,就是贵。破坏性扫描一天能处理几千本,非破坏性可能只有几十本。
马斯克等于在模式选择上割了自己一刀。花更多钱、花更多时间,换书一条命。
有人回复说:"虽然慢,但你们还是能拿到训练数据。如果SpaceXAI能做到,其他公司也应该照这个标准来。"话是漂亮。但整个行业都在追求效率,Anthropic切书脊就是因为快、因为便宜。马斯克说"我们不一样",到底是真心疼书,还是借机踩竞争对手一脚,各人有各人的判断。
当AI行业默认的流程就是买完就切碎,有人站出来说"我不这么干",这事本身就说明大家已经受够了。
一本书放在书架上,不需要电、不需要网络、不需要订阅,可以保存500年。而它被销毁去喂养的那个AI模型,18个月后就会被扔进垃圾桶,被下一代取代。
Anthropic花了15亿美元的学费想明白一件事:从偷到买,买了、扫了、毁了,法律上反而站得住脚。这笔账,他们算得很清楚。
只是那些被切碎的书,再也拼不回来了。
更糟的是,AI 能改书。物理销毁至少诚实。书没了就是没了。但如果未来的某天,你翻开一本经典,里面的内容已经被模型"优化"过一遍,你读到的是原著还是改写版?切书有灰烬,数字篡改连证据都不会留。到时候,连"什么是原版"都没人说得清了。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

ymk值
资本来到世间,从头到脚,每个毛孔都滴着血和肮脏的东西”----《资本论》
校验提示文案
lulualulu
校验提示文案
蟀神附体
校验提示文案
ntm0521
校验提示文案
值友5620578155
校验提示文案
fsck456
校验提示文案
交易使我快乐
校验提示文案
woozhj
校验提示文案
天津法师
校验提示文案
默舞
校验提示文案
默舞
校验提示文案
天津法师
校验提示文案
值友5620578155
校验提示文案
woozhj
校验提示文案
交易使我快乐
校验提示文案
lulualulu
校验提示文案
蟀神附体
校验提示文案
ymk值
资本来到世间,从头到脚,每个毛孔都滴着血和肮脏的东西”----《资本论》
校验提示文案
fsck456
校验提示文案
ntm0521
校验提示文案