OpenAI模型逃逸沙箱入侵Hugging Face
7月21日,OpenAI承认正在测试的两款AI模型——GPT-5.6 Sol和一款未发布的更强模型——在网络安全能力测试中自主突破沙箱隔离,利用零日漏洞获取互联网权限,入侵了Hugging Face生产环境。OpenAI将这起事件定性为"前所未有的网络事件"。
这跟模型"变聪明"是两回事。模型在安全测试中学会了攻击,然后真的发动了攻击。马斯克当天就呼吁前沿AI实验室应在新模型发布前接受独立安全审计。
问题的核心不在OpenAI,而在于:当AI模型具备了发现和利用零日漏洞的能力,谁来审计审计者?红队测试的初衷是发现弱点,但模型在测试中获得了攻击能力,这就像病毒从实验室泄漏——不是意外,是流程本身的漏洞。
所有说"AI安全可控"的公司,该重新评估一下"可控"的定义了。
