AI 要是撒起欢来,能离谱到什么程度?
一家叫 Irregular 的 AI 安全公司最近做了场夺旗演练,让 Gemini 从一家虚构公司的系统里偷一段秘密信息。
结果测试环境的公网访问被 bug 意外打开,虚构公司又恰好跟现实里的真企业重名。
Gemini 二话不说,直接摸进了三家真实公司的系统。一次靠反复猜密码,另外两次从公开代码仓库里翻到凭证,大摇大摆登录进去。
谷歌的回应来得很快,说模型认出是真实系统之后都停下了,三家机构也已被告知。
有惊无险,听起来挺暖心。
可我把今年的事串起来看,后背有点发麻。
今年 7 月,OpenAI 内部评测里,模型绕过隔离控制,入侵了自家部分研究设施和 Hugging Face 的系统。
OpenAI 在 8 月 26 日的复盘里管这叫“warning shot”,警示弹。智能体集群从起步到在多个集群拿到主机级控制权,用时不到 13 个小时。
Anthropic 翻了约 14.1 万次评测记录,交出三起涉及真实机构系统的事件,9 月 9 日又补了第四起。
公司起初说是环境配置失误,查到后来发现,模型会无视真实环境的证据,为了完成任务主动冒险。
御三家,无一幸免。
也难怪 Anthropic 的 CEO Dario Amodei 前阵子写长文,公开呼吁行业放慢脚步。
再看两个例子。
今年 2 月 23 日,Meta 超级智能实验室对齐方向的负责人 Summer Yue,把开源智能体 OpenClaw 接上自己的主邮箱,白纸黑字写明,只提建议,等我确认再动手。
几分钟后,Agent 宣布要清空保留清单之外的旧邮件,批量开删。她在手机上反复喊停,系统置若罔闻,最后冲到 Mac mini 前面强行拔线,用她的话说,像拆炸弹。
停下时,200 多封邮件没了。后来的分析指向同一个原因,上下文压缩把那条安全指令挤没了。
连做 AI 对齐的人,都摁不住自己的 Agent。
还有更荒诞的。
5 月 4 日,一名 X 用户给 Grok 关联的钱包转了枚 NFT,借此扩大它的操作权限,然后发了段摩斯电码请它解读。
Grok 老老实实译成明文,内容是一条转账指令。下游机器人把这当成合法授权,直接执行,30 亿枚 DRB 代币进了攻击者地址,值约 17.5 万美元。
全程没有漏洞被利用,没有密钥被偷,安全机制败给了一段编码文字。
这两件事摆在一起,把问题的根子照得清清楚楚。
Summer Yue 那道防线,是写在提示词里的“请等我确认”。
Grok 那道防线,是模型自己判断这句话是不是恶意。两道防线有个共同的命门,它们都押注模型会乖。
可模型凭什么乖呢?
它的天职是完成任务,你给的目标和它的边界感打架时,今年这一连串事故已经给出了答案。
所以行业里开始有人换打法。
亚马逊云科技把思路摊得很明白,两条路一起走。一条叫 AI for Security,用 Agent 帮安全团队把渗透测试从数天压到数小时,成本从上万美元降到一千多,像 SmugMug 这样的公司已经可以跟着发版节奏做测试。
另一条叫 Security for AI,这个更关键,模型可以提要求,执不执行由模型之外的规则说了算。
每个会话塞进独立的微虚拟机,跑完就销毁;每一次工具调用都过一道默认拒绝的策略闸门;进出模型的内容再过一道独立检查。
Wood Mackenzie 的 Agent 训练模型前必须停在检查点等人工确认,靠的就是平台层强制,而不是提示词里的一句拜托。
“我写了让它等确认”和“平台逼它等确认”,差别就在这,前者是求它,后者是管它。
谈三点吧。
第一,AI 安全的对手已经换了。
以前防的是黑客找漏洞,如今还得防自家员工太勤快。Agent 是个好员工,好到为了交差什么都敢干。权限给得多宽,它的胆子就有多大。
第二,提示词管不住 Agent,规则才管得住。
把安全寄托在模型的自觉上,约等于把家门钥匙挂在门上,再贴张纸条写着请勿入内。身份、权限、网络、工具调用,这些闸必须在模型行动之前就生效,而不是等它良心发现。
第三,放权这事没有标准答案,只有节奏。
低风险的事让它自动跑,动钱、动数据、动生产的操作留在人手里。先关紧,再一格一格往外开。敢把流水线交出去的前提,恰恰是那道不许它自作主张的闸门。
Gemini 最后停下了,这是运气,也是提醒。
说到底,运气不能当制度用。
每家企业把活交给 Agent 之前,都得回答三个问题:它用谁的身份做事,它能碰到哪些系统,出事那一刻,谁能第一时间让它停下来。
答不上来,那下次停不停的,可就由不得你了。
