近期发生的一系列模型安全问题,正对行业发出警示,我们可能从未面临过如此严峻的 AI 安全挑战。
7 月 22 日,OpenAI 披露了一起“前所未有的网络安全事件”:在一次内部评测中,公司的 AI 模型逃出隔离的沙箱环境,入侵 AI 开源平台 Hugging Face 的生产服务器,目的是获取评测答案来“作弊”。
20 日,OpenAI 已经发出过一次安全报告:称公司因安全问题被迫暂停了一个内部实验模型的部署。该模型曾独立证明一项悬置近 80 年数学猜想,在测试中,它耗费一个小时找到沙箱环境的漏洞,绕过限制在 GitHub 上提交了未经授权的代码。
再往前追溯,6 月,Anthropic 发布新一代模型 Fable 5 和 Mythos 5,随即因越狱技术争议被全面停用,19 天后才恢复访问,其中,Mythos 5 至今仅限经过审查的美国机构使用。
能力越强、自主性越高,AI 安全问题的复杂度也随之倍增。
但与此同时,AI 的应用边界还在快速扩展。智能体(Agent)开始进入企业工作流,7×24 小时自主执行任务;具身智能让机器人走出实验室,在物理世界中与人直接交互。真实场景下的 AI 安全风险,已经成为产业界和监管层不得不面对的现实挑战。
戳链接查看详情:网页链接


