AI公司疯抢旧书:这3个坑不懂,你的书永远卖不上价

源自16位全网作者

07-31 23:09

内容由AI生成

精选参考来源

1. AI 公司把旧书摊买空了

2. AI把旧书价格炒了5倍!40岁大叔用AI做二手书生意,月入5000的实操步骤

3. 现在没人看书了,邻居一斤一块收旧书,一年挣了十几万

4. 二手图书倒卖轻副业,不用门店,小白照着流程做,隔天就能出单

5. AI公司疯狂扫货旧书,一次买100万本!40岁普通人看到的3个信号

6. 闲置的书怎么卖出去 怎么卖我们的闲置二手书

7. 旧书打包别再用袋子了!这5个细节让买家收到完好如新

8. AI公司为何疯狂收购旧书?——一场关于“干净数据”的隐形争夺战

9. AI公司被曝疯狂收购大量旧书!扫描完成直接销毁,其目的让人警惕

10. AI公司高价收购旧书却销毁,为何引发众怒?

11. 你扔的旧书,正在被AI公司高价疯抢!背后原因让人意外

12. AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!   因为2022年前的老书没有AI垃圾污染,AI公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!连18世纪存世极少的植物学孤本都被绞碎了! 事情的主角之一,是开发Claude的人工智能公司Anthropic。   这家公司在2024年启动了一个内部项目,代号“巴拿马计划”。后来公开的文件显示,这个项目的目标非常直接,就是尽可能大规模地破坏性扫描图书,而且不希望外界知道。   一份承包方案甚至提出,要在半年内处理50万到200万册书。   这不是拿手机一页页拍照,而是一条工业流水线。液压设备负责切掉装订部分,高速扫描仪负责读取书页,剩下的纸张统一交给回收公司。 效率很高,代价也很直白,一本书进去,一份数据出来,原书从此消失。   AI公司为什么突然盯上旧书?   原因有点讽刺。互联网原本是训练人工智能最大的文本矿场,可生成式AI普及以后,网上越来越多文章、评论、商品介绍,甚至学术摘要,已经带有机器生成的痕迹。   模型继续抓取这些内容,就像拿自己排出的废气重新灌回发动机。数据看起来很多,真正由人写作、编辑和校订的内容却越来越难分辨。   2022年以前出版的实体书,因此成了一片相对干净的矿区。那时候,大规模生成式AI还没有涌入出版市场。 一本经过编辑、校对和正式出版的书,不一定观点正确,却通常有完整结构,也不会是聊天机器人东拼西凑出来的段落。   更重要的是,旧书里藏着大量互联网上找不到的细节。   地方史、早期植物分类、冷门工程手册、绝版行业年鉴、小语种文学,这些内容可能没有电子版,也不会出现在热门网页里。 对普通读者来说,它们很偏;对急着提升模型能力的公司来说,这恰恰是别人没有的数据。   于是,曾经服务书店和图书馆的图书数据库公司,也开始做起大宗采购生意。有平台宣称可以按照书号和年代,一次寻找数千到上百万册图书,还能替最终买家保密。   这就很反常了。   真正的藏书人会问版本、装帧、批注和保存情况。训练数据采购方在意的却只有一件事:机器能不能把字读出来。普通重印本和稀少初版本,在采购表格里可能只是两个编号。   我认为,问题并不在于每一本旧书都必须供起来。   图书馆每年会淘汰破损书,二手书市场也会处理大量卖不出去的重复版本。一本印了几十万册的普通教材,被切开扫描,未必是什么文化灾难。 把所有破坏性扫描都叫作“焚书”,反而容易把真正的风险说轻了。   真正危险的是采购过程不透明,而且缺少一道筛选程序。   如果一本书还有几万册,销毁一册影响有限。 可如果它是带有作者批注的特殊版本,是地方小印厂留下的少量样书,或者是存世数量已经很少的早期科学著作,那么书页上的纸张、颜料、水印和装订方式,本身就是信息。   扫描只能留下文字和图片,留不住纸张年代,也留不住修补痕迹。模型读懂了书里的句子,研究者却可能永远失去那件实物。   法律又让这件事变得更微妙。美国法院曾认为,把合法购买的纸质书一对一转成内部数字副本,并用于检索和训练,在相关案件中可以构成合理使用。 但从盗版资料库批量下载图书,则是另一回事。   也就是说,买下书再切碎,法律风险可能比直接下载盗版更低。   这就出现了一个荒诞场面:为了让人工智能合法地“读书”,最稳妥的办法之一,竟然是先把真正的书毁掉。   在我看来,AI公司并非不能使用旧书,关键是不能把文化保存责任甩给切割机。大批采购之前,至少应该检查版本稀缺程度。 普通复本可以破坏性扫描,珍本和绝版书应采用无损设备。扫描完成后,也可以把原书转交图书馆,而不是统一回收。   更进一步说,如果企业靠这些书训练出商业模型,那么对于已经进入公共领域的稀缺文献,数字副本也应适当向研究机构开放。 不能原书变成纸浆,扫描件又锁进公司的服务器,最后全世界只能花钱向聊天机器人提问。   人工智能确实需要好数据,但好数据不是凭空长出来的。它来自作者几年甚至几十年的积累,也来自编辑、印刷工人和一代代藏书人的保存。   最让人不舒服的,不是机器终于开始读古书,而是它读完以后,可能把书架也一起吃掉了。

13. AI公司疯狂收购旧书:拆书扫描后直接销毁,背后藏着哪些隐患?

14. AI公司疯狂收购旧书?

15. AI公司被曝疯狂收购大量旧书!扫描完成直接销毁,其目的让人深思

16. AI公司开始大量收购旧书了,因为互联网已经被AI自己污染了。。。

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章