众力资讯网

百万好书被AI销毁:法院判合法,这合理吗?

最近硅谷 AI 圈炸开了锅,这帮搞技术的人,居然干起了烧书的勾当,还打着 “训练优质训练数据” 的旗号。有业内公开规划文

最近硅谷 AI 圈炸开了锅,这帮搞技术的人,居然干起了烧书的勾当,还打着 “训练优质训练数据” 的旗号。

有业内公开规划文件直接喊出口号,要破坏性扫描世界上每一本书,这条消息在海外社交平台上线一天就爆了,斩获 1000 万阅读量,全球网友集体愤怒。

为啥这么多人骂?因为硅谷 AI 大厂正在疯狂抄底稀有纸质书,用来训练大语言模型,为了方便机器自动扫描,他们会直接把书切开,拆成零散纸张,扫描完成电子版后,原版纸质书直接销毁。

一次订单少则 1000 本,多则 100 多万本。上百万本珍贵的纸质书,就这么变成了碎纸,连一点痕迹都留不下。

这些公司对外的借口听着很离谱,说 “世界上最好的 AI 训练数据,就放在书架上”。

而他们这么做的根源,在于当前互联网上的训练数据,一半以上都是 AI 生成的,用这些数据反复训练,就像不停复印复印件,噪点越来越多,错误越积越深。

2022 年之前出版的纸质书就成了香饽饽,那时候还没有 ChatGPT,书上的每一行字都是人亲手撰写、推敲打磨的,没有 AI 的复制粘贴。

对 AI 公司来说,这些书就像沙漠里的水,珍贵到极致。

最积极的就是 Anthropic,也就是开发 Claude 大模型的公司,早在 2024 年,该公司高管就接到了特殊任务:要收集世界上所有的书,获取纯净的人类表达样本。

为了节省时间,他们直接批量采购书本,切开后用机器高速扫描,一年花了几千万美元,销毁了数百万本书,一卡车一卡车的书运到工厂,读完就彻底消失。

更离谱的是,这种暴力毁书行为居然合法了,2025 年 6 月,美国联邦法院法官裁定,Anthropic 购买纸质书后转换成数字副本再销毁,属于合理使用,不侵犯版权。

但这真的只是简单的格式转换吗?纸质书可以被传播、继承、转赠,几十年后还可能流落到需要的人手里。

但转换成的电子书,是 AI 公司的私有财产,锁在他们的私人服务器中,外人根本无法接触。

很多绝版、小众的书籍,早就没有出版社留存备份,当纸质书被销毁的那一刻,人类的这段文化记忆,可能就永远消失了。

我不反对用科技手段扫描书籍留存知识,但绝不能用这种不可逆的极端方式,明明可以同时保留纸质书和电子版,他们却为了省点钱、快一点,选择毁掉知识的根源。

如果小众绝版书的原始记录都彻底消失,未来人们就再也无法反驳 AI 生成的错误内容,AI 说什么就是什么,原始版本早就不复存在,数字副本还被少数几家科技公司牢牢掌控。

这不是在训练 AI,这是在用 AI 重写人类的文明记忆。

现在这种操作居然合法,细想之下真的后背发凉,我们留给后代的文化遗产,可能就这么被几家科技公司悄悄毁掉了。