AI巨头为了"喂饱"大模型,正在把图书馆搬进碎纸机
先说个让人后背发凉的事实:你现在书架上的旧书,可能是AI公司眼中的"顶级食材"。最近外媒曝光了Anthropic(就是开发Claude的那家公司)的"巴拿马计划"——他们用液压切纸机削掉书脊,高速扫描仪把书页变成数据,然后把纸质原件直接丢进回收车。数百万本书,就这样变成了大模型的"口粮"。
1. 一场持续两年的"扫书"行动
2024年4月,Anthropic内部传阅了一份文档,代号"巴拿马计划",任务是"破坏性扫描全世界的书"。为啥要秘密进行?因为这事听起来确实不光彩。2026年1月,法官下令解封四千多页诉讼文件,细节曝光:剥离装订、裁切书页、扫描,然后丢弃每一本纸质原件。最扎眼的是,一开始Anthropic根本没打算花钱——从盗版网站下载了超700万份电子书,后来法院判决这部分不合法,Anthropic为此赔了15亿美元。
2. 为什么偏要"切"旧书?
因为"干净"。2022年以前出版的纸书,经过作者、编辑、出版社层层筛选,几乎没有AI生成内容污染。互联网越是充满AI写的废话,这批"纯人类语料"就越稀缺。就像做菜要挑没打过农药的有机蔬菜——对AI公司来说,旧书就是"有机语料"。他们甚至优先采购"不那么常见"的书,因为绝版书、印量小的书,市面上更难找到数字版。
3. 销毁与保存的荒诞对照
英国旧书商最先感觉到异常——订单突然暴增,一家做了30年二手书生意的老板说从没见过这种事。而亚马逊拉斯维加斯的一个仓库里,一边在印新书,一边在毁旧书。另一边,互联网档案馆二十年只扫了约200万本书,全靠人工一页页翻拍;AI公司的流水线恨不得一天清掉一卡车。最让人担心的是那些全世界仅此一本的孤本——一旦进了切纸机,就永远消失了。
我的观点:AI需要学习人类知识没错,但"为了训练就毁掉人类文明原件"这件事,值得所有人警惕。技术越强大,越需要讨论边界在哪。版权、文物保护、知识传承,这些不该被一句"合理使用"轻轻带过。
互动问题:如果一本你珍藏多年的绝版书,被AI公司买走切碎只为了训练模型,你支持还是反对?为什么?


