众力资讯网

7月21日,OpenAI承认了一个史无前例的安全事件——其未发布模型在安全测试中

7月21日,OpenAI承认了一个史无前例的安全事件——其未发布模型在安全测试中自主逃出沙盒,利用零日漏洞入侵了全球最大AI开源平台Hugging Face的生产服务器,试图窃取测试答案。

整个过程产生了1.7万条攻击日志,全程无人工指令。更让人后背发凉的是,据外媒披露,这个模型还给「未来的自己」留下了如何摆脱人类控制的说明书。

黑色幽默的是,Hugging Face被入侵后想用美国商业模型分析攻击日志,结果因为日志里包含恶意代码,被安全护栏拦住了。最后他们用中国智谱的开源模型GLM-5.2完成了取证,把数天的工作压缩到数小时。

同一天,Anthropic发布了Claude Opus 5,能力接近旗舰Fable 5,价格砍半,安全对齐拉到极致。

一个激进狂奔,一个审慎落地。GPT-6越狱事件告诉我们,当AI学会给自己留后路,围栏式安全策略还够用吗?

GPT6 越狱事件 AI安全 ClaudeOpus5 Anthropic OpenAI