AI公司,批量抢购旧书

2026-07-31 09:20:12 0点赞 0收藏 0评论

AI公司,批量抢购旧书

当AI生成内容占据互联网新发布内容的一半以上,高质量人类文本成为稀缺资源。

多家AI公司通过中间商大规模收购二手图书,扫描后销毁,只为获取2022年之前“未被机器碰过”的训练数据。Anthropic的“巴拿马计划”曝光了这一隐秘产业链,15亿美元和解金创下美国版权案件纪录。

这不仅是数据争夺战,更揭示了AI产业的核心悖论,它越成功,赖以训练的人类数据就越稀缺。

被切碎的旧书

调查媒体404 Media今年7月披露,多家AI公司正通过数据中间商ISBNdb大规模收购二手图书,切掉书脊、高速扫描、物理销毁。单次订单从1000本到100万本不等,书商们销量在数月内飙升了五倍。Anthropic内部文件显示,其“巴拿马计划”(Project Panama)在一年内花费数千万美元购买了数百万本纸质书,拆解扫描后全部销毁。

为什么AI公司要花大价钱买旧书、拆书、毁书?答案指向一个它们自己制造的问题:互联网已经被AI生成内容污染了。

斯坦福大学2026 AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半(51.72%)。2022年ChatGPT发布之前,这个数字接近于零。Cloudflare的数据同样印证了一个趋势,其托管网站的网络访问请求中,约57.4%来自人工智能和自动化程序,人类请求仅占42.6%。不过该数据衡量的是HTTP请求数量而非人类实际阅读量,一个AI Agent单次可访问数千页面,而人类只需几次点击。

当AI模型用AI生成的内容继续训练时,就会发生“模型塌缩”(Model Collapse)。2024年7月,牛津大学、剑桥大学等机构的联合研究登上了Nature封面。研究者用Meta的OPT-125m模型输入一段关于14世纪教堂塔楼的维基百科文本,第一代输出还在讨论建筑,第五代跑偏到语言翻译,第九代模型开始热情洋溢地介绍各种不存在的兔子物种。从教堂到兔子,只用了九次迭代。

AI公司,批量抢购旧书

递归训练下模型输出质量的退化趋势(基于Nature 2024封面论文实验数据)

论文证明,驱动塌缩的是三类误差的复合效应:统计近似误差(有限采样丢失尾部信息)、函数表达误差(神经网络无法完美拟合分布)、函数近似误差(优化算法本身带有结构偏差)。只要其中任何一类存在,塌缩就不可避免。这是数学必然。

Epoch AI的测算给出了明确的时间窗,语言模型将在2026年到2032年间耗尽人类公开的高质量文本数据。合成数据看似是解药,微软Phi-4、谷歌Gemma等模型都已混入合成数据,但据相关研究显示,训练数据中仅0.01%的虚假文本就能导致模型有害输出增加11.2%,这是指数放大的关系。

理解了“模型塌缩”这个逻辑起点,才能理解AI公司为何愿意花数千万美元去购买那些“2022年之前印刷的纸质书”。ISBNdb在官方博客中直接点明了这一点:“2022年之前印刷的纸质书,在结构上保证没有受到过这种污染。仅此一点,就是巨大的优势。”

AI公司,批量抢购旧书

互联网新发布内容中AI生成内容占比变化(数据来源:斯坦福2026 AI指数报告)

更棘手的是,作者们已经开始反击。芝加哥大学开发的Nightshade工具能在图像中嵌入对人类视觉无影响但会让模型“中毒”的像素级修改。其文本领域的同类工具也在发展之中。

Nightshade自2024年发布以来已被广泛下载。Anthropic联合英国AI安全研究所的研究显示,只需250份精心构造的恶意文档,就能在数千亿token量级的语料库中为模型植入后门。这意味着互联网上爬取的数据无法保证“干净”,只有纸质书,从时间线上就天然免疫。

但问题在于:旧书虽然纯净,获取方式却触发了另一场冲突。

旧书争夺战

ISBNdb原本是一家服务于图书馆、书商和发行商的图书数据库公司,拥有超过1.11亿本图书的目录信息。如今,它已将业务重心转向AI行业。

其官网写道:“书籍代表着经过精心策划、同行评审、特定领域的人类知识,其结构是任何网络爬虫都无法复制的。”它提供从1000本到100万本的批量采购,并承诺严格保密,每笔合作签署NDA,买家姓名永不披露。

据404 Media报道,采购订单有几个异常特征:采购对象几乎全部带有国际标准书号(ISBN),便于数据去重和溯源管理;完全没有主题、类型或作者偏好,小说、教材、专业书籍不加区分;买家完全不在意价格,即使部分图书明显高于市场价,也会直接买下。

一位书商向404 Media表示,过去一周只能卖出约20本书,近几个月每周销量飙升至数百本,是平时的五倍。他坦言:“我个人对此感受复杂,经济上对我有利,但我不喜欢那些不常见的书就这样被粉碎。”

被大量买走的书大多是“长尾、冷门、几乎没有商业价值”的书籍,比如地方史、小城镇志、已消失学科的旧专著、小语种或土著语言文献、自费出版的战争回忆录、印量极小的学术论文集。这些绝版书籍因此更易被批量收购和销毁。

Anthropic的巴拿马计划提供了一个完整的标本。2024年初,该公司启动了这一严格保密的项目。内部文件写道:“巴拿马计划是我们对全世界所有图书进行破坏性扫描的努力。我们不想让人知道我们在做这件事。”

此后一年内,该公司花费数千万美元,购买了数百万本纸质书。负责该项目的汤姆·特维(Tom Turvey)是一位曾参与Google Books项目的硅谷老兵。

今年1月的一篇报道进一步揭示,Anthropic联合创始人本·曼恩早在2021年就亲自从盗版网站LibGen下载了至少500万本盗版图书,2022年又从另一个网站下载了至少200万本(部分法庭文件记载为500万本,具体数量在诉讼中存在争议),并向同事转发链接附言:“真是太及时了!!!”(just in time!!!)。

CEO达里奥·阿莫代伊对此知情,在内部邮件中将寻求正版授权的理由概括为“法律/实践/商业上的繁琐工作”。

具体操作流程:工人使用液压切割机切掉书脊,将散开的书页送入高速生产级扫描仪,转化为高清PDF文件,然后将纸质残骸直接送往回收公司销毁。据法庭文件显示,供应商提案中标注的扫描量在50万到200万本之间,完成周期约为六个月。ISBNdb的服务条款也承认:“大规模扫描通常会毁掉书籍。工人切掉书脊,让散页通过机器,这比小心翼翼的替代方案更快、更便宜。”

ISBNdb的营销文案承认:“AI公司销毁两百万本书确实不是一个能博取同情的标题。”它建议客户将这一行为重新包装为“数字化保存”。然而,图书馆的数字化是为了保存和传播,AI公司的数字化是消耗和训练,扫描后的内容进入私有数据库,公众无法访问。

旧书被买走、拆掉、扫成数字文件,然后物理销毁。这一连串操作在法律上处于什么位置?Anthropic的15亿美元和解案给出了答案。

买书合法,偷书不行

2025年6月,联邦法官威廉·阿尔苏普(William Alsup)作出了一项双重裁定。一方面,他认定Anthropic的破坏性扫描行为属于“合理使用”(fair use),因为训练是“变革性”的。

他将此比作教师教学生写作,认为“作者无权禁止任何人将他们的作品用于培训或学习”。另一方面,同一法官认定该公司在启动巴拿马计划之前,曾下载了一个包含700万本盗版图书的数据库(LibGen),侵犯了版权。

2025年9月,阿尔苏普初步批准了Anthropic以15亿美元(约合101.62亿元人民币)和解提案。2026年7月,法官阿拉塞莉·马丁内斯-奥尔金批准了最终和解。这是美国版权案件中已知的最大和解金额,超过91%的作者和出版商已领取赔偿份额。

这组判决传递了一个清晰的信号:买书、拆书、扫描、销毁,只要书是合法购买的,法院可能不拦你;但如果你从盗版网站下载,代价会极其昂贵,每本侵权作品最高可判罚15万美元。

由此形成了一个荒诞的激励结构:如果你扫描后还留着原书或公开分享扫描件,法律地位反而更弱,因为可能产生新的版权副本并使其流入市场。

Anthropic的律师团队提出了双重辩护:其一,基于“首次销售原则”,合法购买一本书后,所有权人有权对该副本进行任何处理;其二,叠加“合理使用”,扫描件仅用于内部AI训练,不对外分发。销毁原件反而“规避了非法复制”的指控链条。

7月14日,哈切特出版集团、圣智学习集团、爱思唯尔以及畅销作家斯科特·图罗联合在纽约联邦法院对谷歌提起集体诉讼,指控其未经授权使用数百万本受版权保护的图书训练Gemini AI模型。

与Anthropic案不同,谷歌案的核心在于“授权但超出范围”:出版商曾授权谷歌通过Google Books等有限范围内使用作品,但从未授权用于训练商业AI产品。Meta也面临类似诉讼,出版商联盟指控其从LibGen、Anna's Archive、Sci-Hub等多个盗版网站获取了超过267TB的版权材料。

Anthropic的案例揭示了一个奇怪的产业逻辑:从盗版网站免费下载700万本电子书,最终付出15亿美元代价;而巴拿马计划虽然成本高昂,却被法院认定为合法。这种“合法但更贵”的路径正在重塑整个AI训练数据的供应链。ISBNdb正是这一模式的产物:它不生产数据,只是图书的搬运工,但搬运的是法律上干净的数据。

法律的模糊地带催生了新的商业模式,也带来了更深层的隐忧。

被锁进黑箱的人类智慧

这场旧书争夺战揭示了一个悖论:AI公司一边承诺“让人类知识触手可及”,一边在买断、拆毁人类知识最坚实的载体。

扫描后的数字内容进入AI公司的私有数据库,仅用于训练其模型,普通公众无法访问。公众可能获得更智能的AI助手,但代价是大量知识资源正从公共领域消失。

这与图书馆的数字化使命有着本质区别:图书馆数字化是为了保存和传播,公众可以访问数字化后的内容;AI公司的数字化是为了消耗和训练,内容进入私有数据库后公众无法访问。

前者是知识的“放大器”,后者是知识的“黑洞”。

在批量采购中,AI公司是否会区分普通图书与珍贵或绝版图书?如果稀有书籍被拆毁,它们可能永久退出流通。被大量买走的冷门书籍,地方史、土著语言文献、小语种著作等等,其中很多可能已经没有其他存世副本。当采购规模达到百万级别且完全匿名保密时,没有任何外部机制能确保稀有书籍不被混入其中。

对中小作者而言,打击同样真实。Packt Publishing合作伙伴关系副总裁(兼ExpertEdge CEO)Oli Huggins指出,AI公司目前提供的授权报价“在经济上完全不具吸引力”,一张永久AI训练许可证的报价大约只有每本书10美元。世界各地的独立作者无法聘请顶级律所追责,当自己的作品被切碎化为数字比特时,他们能做的只是看着。

AI公司,批量抢购旧书

几组关键数据对比

对中国AI从业者而言,挑战尤为严峻。据业内研究估计,中文高质量数据在全球大模型训练数据集中的占比极低。数据稀缺迫使国内开发者更多依赖机器翻译和合成内容,进一步加剧了数据污染。DeepSeek-V3需要14.8万亿高质量文本片段来训练,这个量级的中文高质量数据,目前根本没有。这使得“获取纯净中文纸质书数据”对中国AI公司而言同样是一个迫切但更困难的问题。

这些隐忧指向一个更根本的问题:旧书是有限的,互联网上的AI生成内容是无限的。旧书耗尽之后,AI还能去哪里?

旧书耗尽之后

即便AI公司今天买光了所有旧书,下一代模型训练时还能找到纯净的数据吗?每一轮AI生成的文本都在污染互联网,而新一轮模型又要从这片被污染的海洋中捞取训练素材。收购旧书只是延缓了模型塌缩的速度,并没有解决根本问题。

学术界正在探索多条出路。

有研究证明,只要真实数据在训练循环中持续存在(“累积”而非“替换”范式),模型性能不会急剧恶化。独立研究者提出的“反吞尾效应”实验表明,质量过滤器不仅能减缓退化,甚至可能逆转它。今年5月发表于《物理评论快报》的研究也发现,只需在训练中加入一条来自封闭循环之外的真实数据,就能有效阻止模型塌缩。

但这些技术路径都有局限:它们赢得的是时间,不是永恒。模型塌缩的根本矛盾是,AI的成功正在毁掉它赖以成功的数据,会因为技术优化而消失。

我们需要的不仅是更高效的数据获取方式,更是一套让技术进步与知识传承、商业利益与公共权益、AI能力与人类尊严之间保持平衡的新契约。

当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。人类花了几个世纪积累的知识,AI公司正在用几年时间消耗殆尽。这不再是一个技术问题,而是一个关于人类文明如何与人工智能共存的根本问题。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 焦燕)

作者:AGI-Signal

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章

钛媒体APP

新鲜犀利的财经见闻,放眼国际的前沿技术,还有罕见披露的内幕消息。钛媒体(www.tmtpost.com),引领未来商业与生活新知,一个投资者与创新者酷爱聚集的地方。还可下载钛媒体App,24小时不间断更新和互动。

发文累计被1267人收藏

关注 打赏
作者其他文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松