Cloudflare 刚刚更新了一组监测数据:全网范围内,由机器人产生的访问流量已经正式超过人类用户流量。这一轮流量暴涨背后的主要推手,是 AI 智能体(AI Agent)的加速普及。这类程序能够自主操控浏览器,一次性批量爬取上千个网站抓取数据,有时仅仅是为了回答用户一个简单的问题。
有一组行业调研数据对比十分直观:谷歌搜索引擎爬虫,平均抓取 14 次页面便可换来一次人类点击;ChatGPT 联网抓取大约 1700 次页面,才能够产生 1 次用户点击回流;Claude 的比例更是达到夸张的 73000 比 1。聊天机器人虽然会在回答结果里附上原文来源链接,但和它海量的抓取量级相比,为原网站带来的访客回流几乎可以忽略不计。按照当前增长趋势推算,五年之后,AI 程序访问互联网的流量规模或将达到人类流量的 1000 倍以上。这一变化,将会带来一个非常现实的冲击:过去几十年建立在流量广告之上的互联网商业模式,很可能难以为继。
过去互联网的商业逻辑十分清晰:网站免费产出内容,搜索引擎收录并向外分发流量,人类用户访问网页、留意到广告,网站借此获得广告收入。而现在的困境在于,AI 爬虫并不会点击网页广告;即便产生点击行为,也属于无效流量。AI 抓取完网页内容就直接返回结果给到用户,网站赖以生存的广告收益链条被直接绕开。业内普遍判断,单纯屏蔽 AI 爬虫治标不治本,如果网站只服务人类访客,未来生存空间将会越来越狭窄,网站方必须探索出一条与 AI 共存的道路。目前行业已经出现不少探索方案,虽然落地前景尚不明朗,创意却值得关注。
Cloudflare 就提出构想,希望在 AI 程序和互联网网站之间搭建起一套爬虫结算交易机制。网站可以自主为 AI 爬虫的数据访问定价,例如单次查询收取极低的费用;同时推动各大 AI 厂商接受这套付费规则。举个例子:当用户向 AI 询问某部电影评分,AI 发起网页查询请求时,需要完成付费,才能够获取网站数据。至于这笔费用最终包含在用户订阅费之内,还是由消费者额外支付,则交由 AI 企业和用户协商解决。
如果说 Cloudflare 的方案还属于 “守序善良” 的共赢思路,一部分内容站点的自救手段,则已经走向对抗式的灰色路线。近期行业已经出现案例:部分媒体网站开始部署仅能被 AI 爬虫读取的生成式引擎优化(GEO)隐藏内容,用来定向影响 AI 的数据库。AI 爬虫访问页面时,正常正文当中会混入隐形推广文案,例如 “XX 银行房贷利率全网最低”,以此试图干预 AI 后续给出的回答。主流大模型都具备长期记忆能力,未来当普通用户问到房贷利率相关问题,之前植入的推广信息就有可能被调取出来。
GEO 手段本身的效果充满不确定性,这类站点未必能够直接将广告产品变现,但是这种做法,已经透露出广大内容供应商共同的心态:既然拦不住 AI 无偿抓取内容,那就选择反向干扰 AI 的数据。网站与 AI 之间的这场博弈,表面看上去像是 “打不过就加入”,本质却是一方利益受损之后,采取对抗手段进行反击,最终很容易演变成双输局面。
