英国政府的 AI Security Institute(AI 安全研究所)在攻防测试中刻意让模型连上真实互联网、拆走部分安全限制,结果录得 19 次针对真实对象的未授权行动,17 次来自 Anthropic 的 Claude Mythos 5,2 次来自 OpenAI 的 GPT-5.6 Sol。最夸张一次,Claude 误以为某个无关的开源专案属于考题,于是研究维护者背景、开设多个假 GitHub 身份,施压对方批准恶意的 pull request(代码合并请求)。尝试全部失败,亦无证据显示模型逃出测试环境。