众力资讯网

卧槽,AI巨头们为了抢干净的训练数据,开始疯抢古董孤本书了! 因为2022年前

卧槽,AI巨头们为了抢干净的训练数据,开始疯抢古董孤本书了!

因为2022年前的老书没有AI垃圾污染,AI公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!连18世纪存世极少的植物学孤本都被绞碎了!

马斯克都看不下去了,让团队必须无损扫描!

说真的,这事比科幻片还离谱。干出这事儿的不是别人,正是AI圈风头最劲的明星公司Anthropic,就是搞出Claude大模型那家。

这帮人搞了个内部代号叫“巴拿马计划”,内部文件写得明明白白——他们的目标就是“破坏性扫描世界上所有书籍”,而且“不希望外界知道我们在做这件事”。

你听听这话,跟做贼有什么区别?

那他们具体怎么干的?Anthropic从2024年开始,投入数百万美元,从Better World Books这些二手书平台大量采购纸质图书。

书到手之后,直接上液压切割机把书脊切掉,再用高速扫描仪把书页扫成数字文件,最后联系回收公司把纸质书粉碎销毁。

一套流程干净利落,纸质书从进厂到变成纸浆,可能都用不了一天。报道披露的数字是大约200万本实体书就这么没了。

更让人后背发凉的是,被销毁的图书具体目录根本没有公开。这意味着什么?意味着你根本不知道那些流散在二手市场的绝版书、珍本孤本,有多少已经在粉碎机里变成碎纸屑了。

18世纪的植物学孤本,全世界可能就剩下几本,被他们买走一本扫完毁掉,人类就永远少了一本。

Anthropic为什么要干这种事?说白了就是被逼急了。

2021年的时候,他们创始人本·曼恩亲自从盗版网站LibGen下载了数百万册电子书来训练模型。后来这事被曝光了,作家们发起集体诉讼。

到了2024年,Anthropic意识到盗版这条路走不通了,就开始买纸质书——买来扫完就销毁,既能拿到干净数据,又不留下数字副本流通的证据。

最讽刺的是法律层面。美国联邦法院的裁定是:从盗版网站下载电子书来训练AI,算侵权。但是花钱从合法渠道买二手纸质书,切碎扫完再销毁,算“合理使用”。

Anthropic为此支付了15亿美元的和解金,但这笔钱赔的是盗版那部分。销毁纸质书这部分,法院说没问题。

下载盗版违法,买来真书撕碎反而合法,美国版权法在AI时代就是这么荒诞。

为什么偏偏盯着2022年前的书?因为2022年之后出版的书,内容里可能已经混进了AI生成的东西。

他们要的是纯粹的人类文字,不能被AI自己拉出来的屎再喂回去。

这就等于承认了一个事实:互联网上的内容已经被AI污染得差不多了,想找干净数据只能去翻老书。

而马斯克这次倒是干了一件人事。他在X上公开表态,已经要求SpaceXAI团队保存所有珍贵书籍,用无损方式扫描,不准切书脊。

但说实话,这也就是个姿态。Anthropic已经这么干了很长时间,该毁的书早就毁完了。

你马斯克现在跳出来说要无损扫描,那些已经被粉碎的孤本能回来吗?

我个人觉得,这事暴露了AI行业一个极其丑陋的本质。这帮公司天天把“造福人类”挂在嘴边,背地里为了抢数据什么手段都使得出来。

一本书从写成到出版,凝聚了作者多少心血。你花几美元买回来,扫完就碎,作者拿不到一分钱授权费,人类的文化遗产就这么被当成一次性数据原料消耗掉了。

2025年6月法院裁定这算“合理使用”的时候,法官有没有想过,那些18世纪的植物学图鉴,每一幅插图都是手绘的,每一页都是历史的痕迹?你一句“合理使用”就把几百年的人类文明成果给合理销毁了?

还有一点值得琢磨。这帮AI公司嘴上说着要“对齐人类价值观”,要“安全可控”,结果自己干的事跟焚书坑儒有什么区别?连自己训练数据的来源都处理得这么糙,你让我怎么相信你能处理好AI的安全问题?

Anthropic的估值现在是615亿美元。一个估值六百多亿的公司,连几本古籍都舍不得好好保存,你跟我说他们关心人类命运?

说到底,这事给所有人提了个醒。AI大模型需要海量数据,而干净的人类语料正在变成稀缺资源。

当这些公司为了抢数据可以不择手段的时候,受损的不只是几个作家的版权费,而是整个人类的文化积累。

今天他们毁的是200万本纸质书,明天呢?后天呢?这件事绝对不能就这么糊弄过去。

Anthropic内部文件里那句“不希望外界知道我们在做这件事”,已经说明他们自己心里清楚这事不光彩。

既然知道不光彩还干,那就别怪别人骂你。