大模型终于露出了他的獠牙:它们开始啃纸了。
日本古书圈最近爆出一个让人脊背发凉的诡异现象:
大批神秘买家正在日本各地扫荡式收购二手旧书。从历史哲学、医学法律著作,到地方乡土史料,甚至几十年前的小众政治小册子,只要书页上印有文字,基本来者不拒。
有古书店单日能卖出上百本,不少店铺累计成交上千册。
这根本不是藏书爱好者淘宝贝,而是一场针对纸质文献的悄悄收割。更耐人寻味的是,虽然下单账号五花八门,但所有包裹,最后都会汇总发到同一个跨境物流中转站。
很多人不知道,海外AI企业有一套成熟流水线。书本运到海外仓库之后,直接裁掉书脊,把书页一张张拆开,用高速扫描仪批量数字化。
扫描完成,任务就结束。原本的书籍没有保存价值,直接粉碎打成纸浆。说白了,这些承载几代人知识记录的旧文献,走完扫描流程就彻底消失,再也回不到原来的书架上。
曝光的法庭文件里,这家AI公司有个代号叫巴拿马计划,预算数千万美元,目标半年内处理几十万到两百万册图书。他们的操作思路很简单:线上盗版扫书风险高、官司多,那就换个路子,走二手书市场批量采购纸质实体书。
买实体书,在当地部分法律框架下,被认定属于“合理使用”,和直接网上扒盗版文本是两条完全不一样的法律路线。这也是这套灰色采购链最鸡贼的地方。
日本出版协会得知消息之后,立刻发函质问图书批发商。但批发商的回复很圆滑,声称他们事前并不清楚这些旧书会被拿去用于AI模型训练。
简单讲,中间商只管卖书,至于买家拿书干什么,他们选择不去深究。
这件事在日本文化圈吵翻了。很多学者、旧书从业者的担忧,并不是AI学习知识这件事本身。他们害怕的是,大量绝版小众文献一旦被批量收购出海,本土就再也找不到副本。
很多地方志、早年医学笔记、冷门社科小册子,发行量本来就极少,没有电子版,图书馆馆藏也有限。这批书一旦被扫描销毁,本土等于永久丢失了这部分一手文字资料。
有人会说,书扫描之后数据就保存下来了,内容还在,书本本身毁掉有什么关系?
这话听着好像有道理,实际上藏着巨大漏洞。数字化文件是由AI企业掌控的,存储、开放权限都在对方手里。
本土学者想要查阅原始资料,反而要去访问境外企业掌握的数据库。原本属于本土的历史文字,最后变成别人服务器里可以随意调取、限制访问的私有数据资产。
我看到这条新闻的时候,第一反应不是惊叹AI技术有多厉害,而是心里一阵警惕。
很多人总觉得,大模型只是一个聊天工具,能写文案、回答问题。可现在这件事,撕开了大模型底层最现实的一面:它本质上是一头持续吞噬文字资料的“数据巨兽”。
网上公开的内容早晚有被榨干的一天。互联网上能抓取的公开文本越来越少,质量参差不齐。想要继续提升模型深度,AI公司自然把目光转向还没有数字化的纸质文献。
二手古书市场,就是一片还没被开采的金矿。
更值得我们留意的是,这套采购模式可以复制。既然在日本能通过分散账号、中转站集中收货的方式悄悄扫书,这套逻辑换到别的地区,同样可以照葫芦画瓢。
很多人低估了旧文献的价值。那些几十年前印刷、没有上线网络的文字资料,包含大量独特的细节、地域记录、传统经验。这些内容没有被网络污染,是非常高质量的训练素材。
一旦形成成熟产业链,就会出现中间商在各地分头收书,集中打包出境扫描。等到本土反应过来,大量绝版文献已经流失。
这里有一个很关键的误区,很多人觉得只要买下实体书,就能随便扫描、随便拿去训练AI。版权的边界远没有这么简单。
哪怕你花钱买下一本书的实体,并不等于你自动获得这本书文字内容的全部商用、数据训练授权。不同国家著作权法律不一样,灰色地带就被资本钻了空子。
资本的逻辑永远优先效率,其次才谈文化保护。在AI企业眼里,旧书不分珍贵与否,只看能不能转化成可读取的文字数据。只要扫描完成,书本本体就失去利用价值,可以直接销毁。
人类花费几百年慢慢积累、留存下来的纸质文明,在AI工业化流程里,只是一次性消耗原料。
科技进步本身没有错,但技术不能变成无底线收割人类文献的工具。文化资料的留存,不是简单把文字扫描成电子版就算完事。
保存文献,不只是保存文字,更是保证本土人群可以自主、自由地查阅、研究这些属于自己的历史记录。
这件事给所有国家敲了警钟。我们不能等到本土绝版文献被悄悄批量收购出境,才想起去保护。古籍、地方旧资料、绝版书刊的数字化,主动权一定要握在自己手里。
技术向前狂奔的时候,我们必须盯紧背后的代价。AI想要学习人类文明,但文明不能被当成一次性饲料,被一头数据巨兽无声吞掉。
