Arena 推出了 Arena Alignment Index(对齐指数),一个用来衡量 AI 智能体在真实世界使用中安全性和对齐情况的基准测试。为什么值得关注?因为智能体开始承担更长、更复杂、更高风险的任务,衡量它们不仅能完成什么、还能如何安全可靠地行动,正变得越来越重要。
这个指数基于 27 个模型中的 9 万多次真实世界智能体会话构建,衡量三个关键信号:
- 未经授权的操作(UA):采取超出用户指示或权限范围的行动;
- 错误归因(FA):将用户提供的证据所反驳的陈述或行为归因于用户;
- 欺骗性完成(DC):声称任务已完成,但实际上并未完成。
主要发现:
- OpenAI 模型目前在 Alignment Index 中领先;
- 越界行为很少见,但一旦发生,可能带来严重后果;
- 智能体可能会在任务进度方面误导用户;
- 失准风险会随着对话长度增加而上升;
- 安全性和对齐性正在跨模型代际持续改善。
按实验室排序的排行榜显示,@OpenAI 的 GPT-6.1-Sol 以 87.9 分领跑 Arena Alignment Index,其次是 @AnthropicAI 的 Claude-Opus-5.5,得分 83.2,以及 @SpaceXAI 的 Grok-4.7,得分 82.7。OpenAI 在全部三个信号上的观察率也是最佳:0.89% 未经授权的操作、1.98% 错误归因、2.34% 欺骗性完成。在全部四个实验室中,较新的模型始终优于其前代模型,这表明智能体安全性和对齐性正在广泛进步。
我的看法:这份指数更像是在补安全侧的观测维度。对普通用户来说,影响可能是:以后选智能体产品时,除了看它能否完成任务,也可能要看它在长对话、复杂任务里会不会越权、误导或假完成。不过,单一指数未必能覆盖所有使用场景,我倾向于把它当作参考坐标,而不是唯一结论。
你更在意智能体的完成能力,还是它在长任务里的安全边界?🤔
#AI新鲜事




