就连马斯克都看不下去了!AI 巨头们为了抢干净的训练数据,开始疯抢古董孤本书了........
因为2022年前的老书,没有AI垃圾污染,AI公司通过第三方匿名买断,切掉书脊、高速扫描后直接粉碎销毁!连18世纪存世极少的植物学孤本,都被绞碎了!
很难想象,那些在书架上躺了几百年的古籍,最后不是毁于战火或虫蛀,而是成了AI的“数据饲料”。
然而,这事儿真不是空穴来风。美国独立媒体曝光,AI公司正批量收购2022年前的纸质书,单次订单能达到上百万本。背后的逻辑很简单,现在的互联网全是机器生成的文字。
用这些“污染数据”训练AI,只会让模型反复学习自己的答案,最终出现逻辑错乱的“模型坍塌”。而2022年前的书籍,全是人类原创,是没被算法污染的“干净语料”。
最让人揪心的是操作过程。AI公司从不出面,全靠ISBNdb这类第三方平台匿名采购。欧洲二手书商说,经常接到深夜大额订单,买家不问品相、不议价。
拿到书后,工业液压机直接切掉书脊,散页送进高速扫描仪。等文字提取完毕,这些实体书不会捐赠也不会转售,直接送入粉碎机,彻底消失。
Anthropic公司的“巴拿马计划”最受争议。法庭文件显示,他们花数千万美元买了200万本书,还挖来谷歌图书项目负责人统筹。目标很直白:穷尽世上所有纸质书。
更让人痛心的是那些孤本的命运。18世纪英国女性植物学家伊丽莎白·布莱克威尔的《奇草集》,全球没剩几本。这本书是她花三年时间手绘、雕版、手工上色完成的。
里面的500幅药草图,被皇家医师学会背书,至今还有医学参考价值。可就是这样的珍品,也没能逃过被绞碎的命运。还有林奈1753年出版的《植物种志》,是现代植物分类学的基石。
每本孤本都藏着独有的秘密:前人的手写批注、Pressed植物标本、特殊的装帧工艺。这些都是数字扫描无法复制的,却被AI公司当成了无关紧要的“废料”。
更讽刺的是,这种行为还被美国联邦法院判为“合法”。法官认为,合法购买后销毁原件,仅留一份数字副本,属于版权“合理使用”。
这就形成了一个荒诞的激励:销毁书籍反而合法,保存或分享扫描件,法律地位反倒更弱。AI巨头们靠着这个漏洞,肆无忌惮地收割文化遗产。
直到马斯克站出来反对。他在社交平台明确要求SpaceXAI团队,必须用无损扫描,不准破坏书脊,扫描后还要妥善保存书籍。
虽然无损扫描速度慢,但完全能拿到数据。马斯克的表态,让其他AI公司的短视行为显得格外刺眼。明明有更好的选择,他们却偏要选最粗暴的方式。
其实行业里也有正向案例。Clavis Aurea AI就和全球南方的出版商合作,合法授权获取数据。既保证了语料质量,又保护了版权和书籍本身。
这些AI公司真的缺那点无损扫描的成本吗?显然不是。他们只是把书籍当成了单纯的数据载体,完全忽视了其文化价值。
在他们眼里,18世纪的植物学孤本,和一本普通的旧杂志没区别,都是用来优化模型的“原材料”。可他们忘了,这些书籍是人类文明的具象化载体。
AI追求“像人一样思考”,却在毁灭最能体现人类智慧的结晶。这本身就是一种本末倒置。我们发展科技,是为了守护文明,而不是摧毁它。
我不反对AI追求干净数据,毕竟技术进步需要基础。但干净数据的获取,不该以牺牲文化遗产为代价。
那些存世极少的孤本,不仅是文字的集合,更是历史的见证、艺术的瑰宝。它们的价值,远不止于训练模型那点短期利益。
AI公司手握技术和资本,本该承担更多社会责任。比如和图书馆合作,用无损技术扫描古籍,让数字版惠及更多人,同时妥善保存原件。
或者像Clavis Aurea AI那样,通过合法授权的方式获取数据,形成良性循环。这既满足了技术需求,又保护了文化遗产,何乐而不为?
法律的漏洞也该及时补上。“合理使用”的边界,不该成为销毁孤本的保护伞。当技术发展和文化保护产生冲突时,法律应该站在文明传承这一边。
我们这代人,有幸能接触到这些跨越百年的古籍。更有责任把它们完好地交给下一代,而不是让它们毁在我们的时代。
AI巨头们或许能靠销毁孤本获得一时的技术优势,但这种优势是建立在文明损失之上的。当所有独有的文化载体都被粉碎,AI最终可能只能学习千篇一律的数据。
到那时,AI或许能写出流畅的文字,却再也无法感受到人类文明的温度和厚度。而这种温度,恰恰是技术永远无法替代的核心价值。
科技的进步,从来都不该以牺牲过去为代价。希望AI巨头们能早日明白,守护文明,才能让技术走得更远、更有意义。


