当前位置:
AIGC文章详情

AI公司批量抢购旧书再粉碎?把这一个月时间线看完:三件事是真的,传得最凶的两个说法是夸大的

源自150位全网作者

02:26

「AI毁书」这个话题在读书圈子里已经传了一个多月。有人说AI公司正按吨买书去化浆,有人说法院已经判了毁书合法,昨天(8月24日)又出了新变体:有人向美国联邦贸易委员会(FTC)请愿调查。我去找了请愿的一手出处,没找到,目前只是社交平台上的单方面说法。

与其跟着转发或者跟着辟谣,不如把这一个多月里调查报道、法庭文件、媒体整理的时间线完整捋一遍。结论先放这儿:三件事是真的,两个传得最凶的说法是夸大的。

一、三件事是真的

第一件,AI公司确实在批量买旧书,而且已经是工业化操作。调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁。单次订单从1000本到100万本不等,书商们销量在数月内飙升了五倍。钛媒体Anthropic代号「巴拿马计划」的秘密项目是其中一个完整标本:2024年初启动,一年花掉数千万美元,买下数百万本纸质书,拆解扫描后全部销毁,项目负责人还是参与过Google Books的硅谷老兵。

第二件,买法很反常。订单有三个特征:几乎全部要求带ISBN,方便去重溯源;完全没有主题、类型或作者偏好,小说、教材、专业书照单全收;买家对价格完全不敏感,哪怕明显高于市场价也直接买。ISBNdb官网推介文案说得直白:世界上最好的AI训练数据,就放在书架上。今日头条

第三件,被成吨拉走的不是畅销书,而是没人要的长尾绝版书。被大量买走的书大多是地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集。钛媒体采购逻辑供应商自己写在博客里:2022年之前印刷的纸质书,结构上就能保证没被AI生成内容污染;而这些绝版冷门书的内容从没被数字化,爬虫从没碰过,对AI公司来说就是最干净的训练语料。

AI公司批量抢购旧书再粉碎?把这一个月时间线看完:三件事是真的,传得最凶的两个说法是夸大的

第四件,流程确实以销毁收尾,且是公司主动的选择。工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。钛媒体内部文件写得很直白:巴拿马计划是我们对全世界所有书籍进行破坏性扫描的行动。今日头条为什么销毁而不是留着?一是防止竞争对手再买一遍同样的书,物理销毁等于数据独占;二是规避版权风险,相关判决逻辑下,扫描后还留着原书,法律地位反而更弱,销毁成了更稳的选择。

AI公司批量抢购旧书再粉碎?把这一个月时间线看完:三件事是真的,传得最凶的两个说法是夸大的

二、传得最凶的两个说法,其实站不住

说法一:「法院已经判了,AI公司毁书完全合法,不用担责。」这话只对了一半。同一案件里,从盗版网站下载电子书训练AI,违法,赔15亿美元;但买来实体书,切碎扫描,销毁原件,再训练AI,合法。今日头条也就是说,法官阿尔萨普2025年6月的裁定把界线画在「书是怎么来的」:合法买来的书,切、扫、毁被认定为变革性使用;而Anthropic此前从盗版网站LibGen下载700万本盗版书,这部分就是侵权。案子最后也不是零成本收场——2025年9月,阿尔苏普初步批准了Anthropic以15亿美元和解的提案,2026年7月最终和解获批,这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。钛媒体如果毁书真的「完全合法且无责」,很难解释为什么要付出这个代价。

说法二:「马斯克都公开表态了,要求自己旗下AI团队用无损扫描。」消息曝光之后,马斯克公开表态,要求旗下AI团队采用无损扫描方式,保留原版图书,拒绝破坏性切割扫描。今日头条但顺着这句话去查,马斯克本人和xAI的官方渠道没有任何表态记录,中文互联网上目前只能追溯到二手聚合文章。这个说法现阶段建议当成愿望投射,别当既定事实引用。

还有一个新变体值得一提:昨天开始出现的「有人向美国联邦贸易委员会(FTC)请愿调查AI公司买书毁书」的帖子。我找了FTC官方文件等一手材料,没找到。列入观察清单即可,不必当成既定事实传播。

三、AI为什么盯上书架

根子上是一个词:数据污染。斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半(51.72%)。钛媒体Cloudflare的数据更直观:其托管网站的网络访问请求中,约57.4%来自AI和自动化程序。用AI生成的内容继续训练AI,学界叫「模型塌缩」——Nature封面研究里,一段文本递归训练到第九代,输出就完全跑偏了;Epoch AI测算,语言模型在2026年到2032年间就会耗尽人类公开的高质量文本。所以2022年前的纸质书才从「没人要」变成「硬通货」:它是眼下为数不多、规模够大、能确认基本出自人类之手的语料。

四、对看书的人、写书的人、盯AI的人,分别意味着什么

如果你是旧书买家或收藏者:供应端的变化已经在发生。英国诺森伯兰郡一位开二手书店的老板彼得,从2026年4月起不断接到来自加拿大的大宗订单,买家不问品相,不砍价,书单毫无规律,从拉丁文学术著作到牛仔小说,从19世纪的植物图鉴到上世纪80年代的通俗杂志,什么都要,越多越好。今日头条真正被扫走的是长尾绝版书,小印量的地方志、绝版专著、小语种文献,如果有盯了很久的,建议趁早下手;而2022年之后出版的书基本不在采购范围内,热门新书不需要恐慌性囤积。

AI公司批量抢购旧书再粉碎?把这一个月时间线看完:三件事是真的,传得最凶的两个说法是夸大的

如果你是作者或内容创作者:消息不算好。AI公司开出的授权报价大约是每本书10美元,「在经济上完全不具吸引力」。钛媒体作品如果真被卷进训练流水线,个人维权的现实路径目前只有两条:一是和解分配机制(91%以上的权利人已经领到了钱),二是等新诉讼把边界打开。

如果你在观察AI行业:接下来有三个信号值得盯。其一,FTC请愿是否出现一手材料;其二,7月14日哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合对谷歌提起的集体诉讼(指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型),连同Meta面临的类似诉讼。钛媒体如果「授权但超出范围」也被认定侵权,AI的数据获取成本会再上一个台阶,买书毁书可能反而更多;其三,二手市场上「2022年前出版、带ISBN」的纸书价格是否明显上涨,这是最直接的温度计。

写在最后

一位受访书商说过一句话:「我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎」。钛媒体对读书圈来说,当下最准确的姿势大概也是这样:不必恐慌地转发夸大的帖子,也不必假装什么都没发生。知道哪些书正被成吨拉走,知道哪些说法是夸大的,就够了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章