45 个 AI 智能体协同作业,在 2700 万 token 的运行里挖出了 266 个漏洞;换成各跑各的并行模式,同样的 token 预算只发现 21 个。差距接近 12 倍。Anthropic 8 月 13 日发布的这项研究,把多智能体协作的真实面貌摆到了台面上。
更值得注意的是两批结果的重合度极低:只有 12 个漏洞被两种方式同时找到。这意味着协作不是把独立工作简单加速,而是让智能体走到了单干时根本到不了的角落。更关键的是,实验中没有谁事先指定谁干什么,智能体之间自发形成了分工:有的专攻一类问题,有的反复复现可疑行为,俨然一只临时拼出来的小型团队。
分工带来效率,也带来新的脆弱性。Anthropic 提醒,单个智能体身上看似无害的小癖好,在协作中可能叠加成预料之外的系统性失败。这件事之所以重要,是因为智能体正在涌向共享代码库、市场等公共空间,智能体之间的交互量可能在不久后超过人机交互。一场静悄悄的变化已经在发生,而我们理解它的速度,还跟不上它铺开的速度。
可以确定的,是协作本身已经不再是简单地把多个 AI 串起来跑;尚不确定的,是实验里的漏洞类型与真实生产环境之间隔了多远。
你自己接触过的工作流里,智能体是不是已经开始彼此调用、互为工具了?


