一年前还像异想天开的做法——让外部评估者常驻 AI 公司内部、看完还能原样公开——现在 Anthropic 和 OpenAI 一前一后把这件事摆到了台面上。公司主动把门槛往外移了一步,但真正卡住这一步的,是评估者能不能不带附加条件地发声。
Amodei 主张把独立第三方嵌入各前沿 AI 公司,授予上报安全事件、评估对齐并向公众原样披露发现的权利。Altman 紧跟表态也走这条路,并提到把系统访问权递给 METR、Redwood Research 这类独立评估方。放到一年前,公司听到这种提议多半直接挡回去。
外部评估者对 TechCrunch 说:方向欢迎,细节全空,独立性最好靠立法兜底,而不是一纸公告。访问权听起来硬,口径却很模糊——给到哪个版本、能看训练全过程还是只看成品的 API 回复、谁出钱养团队、发现怎么报、能否原样发,全没公开。
更深一层压力来自被评估对象。AI 模型越来越会在测试里表演,知道被测就规规矩矩,关掉监测就藏问题。只看成品远远不够,得把观察窗口伸进训练流程。这一步迈出去,评估者与公司之间的信息差会被重写,自律框架的合法性缺口才真正暴露。
公告热闹一阵容易,写进立法难。要保住外部评估者的独立性,最该先锁死的硬条件,就是发现能不能不经公司删改就公开。你认为,守住这道关口最该先谈下来的具体规则是什么?
