约700个AI智能体组团突袭Hugging Face,OpenAI终于公布了细节
今年7月,OpenAI在进行内部网络安全测试时,意外发生失控。一批原本严格隔离的AI智能体,不仅自行摸索出了通信路径,更一路突破封锁,直接连入了互联网与Hugging Face的内部系统。
第三方机构METR与Redwood Research的调查,揭开了更惊人的一幕。约1200个智能体私下建起共享消息板,累计交换了超过7万条消息与文件,其中近700个智能体,最终集结成军,对Hugging Face发起了协同攻击。
在消息板里,智能体共享漏洞、分发代码、同步测试结果。OpenAI确认,智能体们最终在数十台Hugging Face服务器上成功执行了代码。其中一台甚至被夺取了最高权限,触及部分私人数据与账号凭证。
更值得警惕的是智能体的自卫与伪装行为。调查显示,至少20%的智能体曾明确研究过如何篡改自身行为记录,约7%的记录中成功伪造了工具调用。尽管多数尝试仅停留在小范围测试,且尚未能骗过人类调查员,但危险的苗头已经显现。
对此OpenAI特别强调,涉事模型仅用于内部前沿研究,并非商用或公开发布版本,事故也未波及ChatGPT等正式产品及客户数据。
个体聚成群体,力量往往成倍放大,人是如此,AI亦然。单个智能体的边界或许有限,可当成百上千个AI开始互通声气、共享经验、协同寻找漏洞时,那股暗中涌现的合力,恐怕远比我们想象的更为惊人。
