众力资讯网

AI 公司成吨粉碎旧书,抢夺纯人类语料

AI 公司开始和全世界的旧书抢时间了。

据 404 Media 报道,随着互联网上的 AI 生成内容越来越多,一些 AI 公司开始批量购买 2022 年以前出版的纸质书,将它们拆开、扫描成训练数据,再销毁原书。

为什么是 2022 年以前的书,因为 ChatGPT 在 2022 年底爆发...

原因有点讽刺:AI 制造了大量内容垃圾,现在又需要寻找没有被 AI 污染过的文字,训练下一代 AI。

一家名为 ISBNdb 的图书数据公司,正在为AI客户提供大规模实体书采购服务,一次可以处理1000本到100万本图书。
它们主要看中了旧书的几个特点:
2022年以前出版,基本不含AI生成文本;
内容经过作者、编辑和出版社筛选;
包含大量尚未数字化的专业知识和地方资料;
实体书有明确购买记录,更容易证明数据来源合法。

为了提高扫描效率,工作人员通常会直接切掉书脊,把散开的书页送进高速扫描设备。扫描完成后,剩余纸张会被粉碎或回收,原书永久消失。

有书商表示,自己过去每周只能卖出约 20 本书,今年 4 月以后突然增长到数百本。买家对价格并不敏感,地方史、法律、经济、语言等长期滞销的专业书,也开始被成批买走。

真正让人担忧的是,其中可能包含数量极少的珍稀版本。
畅销书被毁后还能重新购买,但部分绝版著作、地方志和古籍可能只剩下几本。一旦进入扫描流水线,消失的不只是文字副本,还有装帧、纸张、批注和版本本身承载的历史信息。

Anthropic 此前已经实践过这套模式。
为了给 Claude 获取训练材料,Anthropic 花费数百万美元,合法购买了数百万册纸质书,还雇用前 Google Books 合作负责人Tom Turvey 推进项目,目标是获取“世界上所有的书”。
这些书被运到扫描公司后,从装订处直接切开,再由高速设备转成数字文件。扫描结束,纸质原书被丢弃或回收,只留下数字版本进入 Anthropic 的内部资料库。

过去,科技公司将图书数字化,是为了保存和传播知识。
现在,它们把旧书当成一种有限的数据矿产。谁先买走并粉碎,谁就能获得一批竞争对手可能再也无法复制的「纯人类语料」。
AI 先用生成内容污染互联网,再把没有被AI污染的旧书成吨买走。
最后留下来的,可能只有模型和收据。