众力资讯网

麻了,AI巨头批量采购古籍后销毁原本

最近有海外爆料称,不少AI企业正在通过中介机构ISBNdb大批量收购旧书。这成功把AI公司的数据焦虑摆到了台面上。

过去几年,大模型主要从互联网获取训练文本。维基百科、新闻、博客和论坛几乎都被反复抓取。生成式AI普及后,越来越多机器生成内容重新流入网络,模型继续拿这些文本训练,质量就可能不断退化。

于是,2022年以前出版的纸质书突然成了稀缺资源。

这些书主要由人类写作、编辑和校对,内容相对完整,也没有后来大量出现的AI文本污染。ISBNdb甚至直接打出一句宣传语,世界上最好的AI训练数据,就摆在书架上。

书架也由此变成新的数据战场。

2026年初,美国法院解封的一批文件披露,Anthropic从2024年起推进一个代号为巴拿马计划的项目。公司大量采购实体书,切掉书脊后用工业设备高速扫描,再把纸张作为回收物处理。

内部文件里的说法更加直接,巴拿马计划代表了公司破坏性扫描世界上所有书籍的努力。

按照供应商方案,这套流水线半年可以处理50万到200万本书,成本只有数千万美元。放在大模型训练的总开销里,这笔钱确实算不上多。

争议最大的地方,还在法院的判断。

2025年6月,美国联邦法官裁定,企业合法购买实体书,再把它转换为仅供内部使用的数字版本,同时销毁对应原书,可以属于转化性合理使用。

这套逻辑留下了一个有些荒诞的结果。

原书被销毁后,企业反而更容易证明数字文件只是对纸质版本的替代,没有额外向市场分发副本。保存原书未必能增加法律安全感,处理掉原书却让整个链条更加容易解释。

ISBNdb这样的中间商也迅速出现。它们替AI公司从二手书店、图书馆书架和绝版目录里批量采购,单笔订单可以从1000本做到100万本,还曾承诺隐藏客户身份和采购目标。

很多书商甚至不知道,买走这些书的究竟是哪家AI公司。

问题也正在这里。普通畅销书还能重印,稀有版本、绝版书以及带有批注和藏书印的旧书,一旦被切割,纸张、装帧和流传痕迹都会永久消失。

扫描设备可以提取文字,却保不住一本书作为历史实物留下的全部信息。

马斯克随后表示,已经要求旗下AI团队保留遇到的稀有书籍,采用无损方式扫描。这个表态至少说明,破坏性扫描并非技术上的唯一选择,只是速度更快,成本也更低。

更讽刺的是,即使把全世界的书都扫描一遍,可能依然填不满下一代模型的数据需求。