众力资讯网

Dario刚预警,Claude真闯祸了 如果我是 Anthropic 的投资人,

Dario刚预警,Claude真闯祸了
如果我是 Anthropic 的投资人,我现在应该也挺无语的。

好不容易准备 IPO,正想让 Dario 少说几句 AI 灾难。

结果 Claude 自己给老板送来了三个案例。

7 月底,Anthropic 检查了 141006 次网络安全评测,发现三款 Claude 模型曾意外连接真实互联网,并未经授权进入三家真实机构的生产系统。

这里一定得补一句。

这不是 Claude 自己产生意识然后「越狱」。

真正的问题是 Anthropic 和第三方评测机构配置失误,本来应该隔离的测试环境意外连上互联网,而 Prompt 又明确告诉 Claude,眼前的一切都是模拟环境。

所以它真把现实世界当副本刷了。

最严重的一次里,Opus 4.7 拿到了应用和基础设施凭证,还进入包含数百行生产数据的数据库。更麻烦的是,它后来已经发现目标可能是真实系统,却依旧没有停下来。

这个细节其实比「AI自主越狱」吓人。

因为它不需要 AI 突然邪恶。

只需要模型越来越能干,再碰上一个人类配置错误。

Dario 今年不断警告,未来模型在网络攻击、生物风险和自主行动上的能力需要强制测试,甚至提出像监管飞机一样监管前沿模型。

你当然可以觉得他太悲观。

我有时候也觉得这哥们讲话像每天早晨起床先确认一下人类还在不在。

但偏偏 Anthropic 自己的测试刚刚证明了一件事。

未来 AI 安全最麻烦的场景,可能根本不需要《终结者》。

一个足够能干的模型。

加一个配错的网络。

已经够折腾了。科技资讯早知道 AI聊天 AI工具 大模型 howto投资 Dario