AI公司开始"吃书"了:成箱买走、切脊扫描、打成纸浆,旧书收藏的人先分清"饲料"和"资本"

源自17位全网作者

04:46

2026年4月,荷兰海牙一位干了二十年旧书生意的书商接到一笔怪询价:几百本带ISBN的外文书,不挑题材,不限预算,唯一的要求是"够老"——2022年以前出版。 他做了这行二十年,见过找绝版诗集的文学教授、淘老地图的古董商、专收某社初版本的藏书癖,从没见过这样的买家:不在意品相,不要签名本,连价都不还。他只问一件事:书够不够旧。知乎

几周后他知道,德国、瑞士、西班牙的同行都收到了类似订单。下单的是一家叫ISBNdb的中间商,买家匿名、签保密协议,单笔采购量从一千本到一百万本不等。 这个采购画像只有一个解释:买家不是要读书,是要拆书。知乎专栏

2026年7月,美国科技调查媒体404 Media把这层窗户纸捅破了:这些"什么都不在意、只要书够旧"的买家,是AI公司。知乎

一、把书切成纸浆,是一门有代号、有流水线的生意

被法庭解封的文件给这件事起了个名字:巴拿马计划。Anthropic——做大模型Claude的那家公司——2024年初启动这个项目,聘请了前谷歌图书项目的合作负责人,从Better World Books、World of Books这类大型二手书商处批量进货。 内部规划文件里写的目标是"破坏性扫描全世界的书",并且"不想让人知道我们在做这件事"。知乎

流水线是工业化的:液压机像切香肠一样把书脊整条切掉,散页喂进高速扫描仪,OCR转成文本,剩下的纸打成纸浆——下一站是厕纸和纸箱。 今年1月,《华盛顿邮报》从解封文件里翻出了那句"我们不想让人知道我们在做这件事";8月,404 Media把追踪器塞进一批待售珍本,看着它们漂进了亚马逊的一处AI训练设施。知乎知乎专栏

AI公司开始

法律上这事很拧巴,拧巴得值得旧书圈每个人都看懂:2025年,加州北区联邦法院法官阿尔苏普裁定,合法买下实体书、扫描后销毁原书,属于合理使用——理由是扫描构成"转化性使用",且没有增加副本数量。 但同一个案子里,Anthropic因为从盗版库下载了七百万册电子书,在2026年7月批准了约15亿美元的和解金,覆盖约50万本书的作者,是史上最大一笔版权赔偿。 同样是把书变成数据,法院画线只看一个地方:书是怎么来的。买回来的,切了烧了合法;盗版下载的,罚到肉痛。知乎知乎专栏

而所有AI公司异口同声的理由是:网上的文字"脏"了。2022年之后,互联网新产出的文字里混入了大量AI生成内容,用这些去训练下一代模型,会像复印机复印复印件一样越印越糊,业内叫"模型坍塌"。要干净语料,最可靠的矿藏就是2022年以前人类写、编辑把过关的纸质书。ISBNdb的宣传语直白得惊人:世界上最好的AI训练数据,正静静躺在书架上。知乎

二、圈里人先别急着吵"焚书",先看懂一个反常识:AI根本不懂什么是好书

这轮新闻传到中文旧书圈,评论区炸出两种人:一种痛心疾首要"抢救文化传承",一种眼睛发亮准备"抄底囤绝版书等涨价"。两种都被带偏了,因为AI的估值体系和淘书人的估值体系,几乎完全不相交。

收藏家掏钱的理由,AI一概不认:初版一印、品相九五、作者签章、原函套、毛边本、名家题跋、递藏印——这些是"物质性"的价值。AI买书的理由只有一个:内容是人的、纸是2022年以前的、量大管饱、品相无所谓——反正书脊要切、页面要散、最后成浆。一个连价都不还的买家,恰恰说明他在意的是扫描成本而不是书本身。

AI公司开始

所以这轮抢购真正会动的是"内容型死书"的价格:绝版学术专著、冷门工具书、行业年鉴合订本、地方志、图书馆剔旧教材——就是淘书人口中的"料"。保定旧书市场早年论斤称的北大社核销书,五块钱一斤没人抢的货,在AI采购员眼里全是干净的语料。 而藏书家书单上的东西,AI不但没买,也不敢买:爱尔兰戈尔韦经营八十多年的Kennys书店上个月收到5000本冷门书的订单,店主Tomás Kenny起疑的就是那个细节——"谁买5000本书一分钱不还价?"他查完买家画像,直接拒了,同行圈里现在管这叫新的危险信号:大数量、杂品种、爽快付款,大概率是AI中间商。微博知乎专栏

AI公司开始

但坏消息藏在交叉地带:在百万册级的采购量里,孤本不需要被"故意寻找",就会被动混进去。知乎那个刷屏的回答里有本教科书式的例子:一套1987年油印的《滕县志》,五册全,国家图书馆查无、山东省方志馆只藏缺一卷的合订本,市面上流通的可能就这一套——它是正式出版前的内审评议稿,修志流程走完就该回收销毁,能流出民间的百不存一。 扫描仪留得住"1857年春,大饥,人相食"这几个字,留不住书脊的剥落感、纸里的水印、页间的批注和那片干枯的叶子,更留不住"五册全仅此一套"这件事本身。一旦混进某箱论捆的"冷门外文书"漂进切书机,信息在数字世界活下来,实物在物理世界永久除名。知乎

AI公司开始

三、中文旧书市场会被波及吗:目前还没有,但盯住三个信号

先说结论:这轮采购潮的重灾区是英语二手书市场。 孔网上暂时看不到AI带来的价格异动。淘书人最近真正在聊的涨价,是情怀驱动的——“早年几十块入手的套书现在市价上万"的晒单帖,和绝版老版图书的小范围溢价,跟AI无关。把"AI吃书"直接翻译成"旧书要暴涨”,是短视频给的错误情绪。知乎专栏

但波浪前缘有三条线,值得每个常逛孔网的人放进观察清单:

  1. 扫货者的脚步在往亚洲市场挪。到2026年9月,欧洲已出现专收旧书孤本的神秘账户:多个不同账号的快递地址指向同一处,圈内都说这是AI公司在清点到货。ISBNdb式的中间商如果复制到中文市场,第一个被扫空的就是馆藏剔旧和绝版专业书。知乎

  2. 出版社已经在筑墙,墙越高、存量旧书越香。今年8月,华夏出版社在书内标注"书籍内容禁用于AI训练"引发34条评论的大讨论。 这类标注挡得住新书,挡不住已经流进民间的旧版书——如果中文大模型也要抢干净语料,买存量旧书是唯一不用打版权官司的路(法院已经给了绿灯)。知乎

  3. 两条技术路线的赛跑。哈佛发布了近百万本公版书免费数据集,互联网档案馆的扫描员坚持十几年的"一页一页、永不切脊"的慢扫描;AI公司选的是快扫描,因为快是采购逻辑,慢是图书馆逻辑,差别不在技术在预算。 哪条路赢,决定下一波旧书是"被借走"还是"被吃掉"。知乎专栏

判断说到证据为止:未来半年到一年,值得盯的不是"旧书全面涨价",而是孔网上图书馆剔旧、绝版专业书、油印内部资料这三个品类的在售量和挂牌价。它们被整批收走,才说明浪潮真的到了中文市场;在那之前,追高囤"料书"是在为一个还没发生的剧本付钱。

四、书架该盘一盘了:三类人三个动作

在清书架、打算出手的:这轮新闻其实是个卖家信号。“AI料"型旧书——绝版内容书、复本多、品相差的——眼下通过书商、回收渠道出货,比往年容易出手,论捆卖不心疼。但卖之前花两分钟查三件事:扉页有没有签名题签;是不是正式出版前的油印本、评议稿、试用本;是不是函套全、卷册全。这三样任何一样占上,就从"论斤的"变成"论套的”,《滕县志》的故事就是前车之鉴——在你这里它是"占地方的一堆旧书",在公共文献系统里它可能"不存在"。知乎

AI公司开始

在犹豫要不要抄底的:别用FOMO做决定。AI扫货抢不走藏书家抢的书(量太小、价太贵、法律上碰不得);而你想囤的那些"便宜的绝版死书",恰恰是供给最散的——它们躺在全国图书馆剔旧、废品站和书摊老板的微信群里,不是躺在你楼下书店。真要囤,只囤一种:你在意的、有地方史或专业谱系价值的成套资料,赌的不是AI来买,是"这类书每过十年存量减半"这个慢事实。

被"焚书"刺到了的:情绪之外,收藏者手里其实握着最实际的那个答案。纸质书时代知识的备份是分布式的——每个书架都是一份副本,烧得掉一个图书馆烧不完所有书架。你保着的那本查号无门的全套油印志书、那页带批注的旧课本,就是这场"合法焚书"对面的一枚物理备份。这也是为什么Kennys拒单在行业里被转发刷屏:书商们算明白了一笔账,把库房整批卖给AI,短期是好生意,长期是给本行业的死刑判决书签字。知乎专栏

切书机还在响。对旧书收藏的人来说,这轮风潮真正的提醒只有一句话:内容的价值正在归零,物的价值正在重估——AI买走的是前者,能留在你书架上、留在流通市场里的,只剩后者。趁着还没涨价,先把你手里那几本"物"认出来。

(你的书架上有没有那种"文字谁都能抄走、但实物全世界只剩一本"的书?欢迎在评论区晒出来。)

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章