众力资讯网

OpenAI 一天解雇三名安全研究员:他们跟外面说了什么

九天前,他说要让外面的人进来看。十九天后,公司里最想让人进来看的三个人,被请出去了。 10月1日,华尔街日报先报的消息:
九天前,他说要让外面的人进来看。十九天后,公司里最想让人进来看的三个人,被请出去了。
10月1日,华尔街日报先报的消息:OpenAI解雇了三名研究员。公司发言人给法新社的声明是原话——“我们已与三人分道扬镳。调查确认,这些人在公司既定流程之外处理了敏感信息,违反了我们的政策,破坏了工作中至关重要的信任基础。”三个人据报是 Jasmine Wang、Tomek Korbak、Mikita Balesni。截至发稿,OpenAI 没有公开确认这三个名字,也没说是哪家外部机构拿到了信息。


把两件事并排摆:9月12日,奥特曼在 X 上写了一段话,夸 Anthropic 给外部评估方“员工级访问权限”的主意好,“我们也会这么做”。10月1日,三名安全研究员因为把信息给了“一家评估 AI 模型的外部机构”而被解雇。中间隔了19天。
9月10日,Balesni 在 X 上发了一句:“我在 OpenAI 工作,我认为 AI 有超过10%的概率杀死全人类。”9月11日,Korbak 发的是:“我对 OpenAI 做的很多事相当不满。我非常高兴自己被允许说我对 OpenAI 做的很多事相当不满”9月9日,Wang 回应前 Anthropic 研究员考克森辞职时说:“很难夸大加速冲向 RSI 有多危险。”RSI 是“递归自我改进”,指模型能不断改进自己。9月10日她还有一条:她和一个叫“pacing the frontier”的请愿签了名,签名者1385人,她估算是全体前沿实验室员工的8%到10%。


这三个人不是普通员工。Korbak 和 Balesni 是一篇叫《思维链可监控性》论文的前两位作者,作者名单里还有 OpenAI 首席科学家 Pachocki 和图灵奖得主本吉奥。辛顿、伊利亚·苏茨克维、舒尔曼、鲍曼在文末署名——他们是“背书人”,不是作者,这一点常被写错。论文讲的技术判断是:让 AI 把思考过程用人类语言写出来,人类就能读它有没有坏心思。
WSJ 和多家媒体都写了一句关键的话:目前没有证据显示,被分享出去的信息跟今年7月那起 Hugging Face 事件有关,也没有证据指向 METR 或 Redwood。这两家是7月那起事件的独立调查方,Korbak 正是 OpenAI 跟它们对接的技术联系人。两件事得分开写:Korbak 参与过调查是真的,他这次被解雇跟那件事有没有关系,公司没说,记者也没查到。
公司没说的还有一件:这三个人有没有先走过内部举报渠道。OpenAI 今年9月刚公开说过,公司有内部渠道让员工反映安全问题。这三人是不是先走了、有没有得到回应,公司没回应这个疑问。Bloomberg 还提了一句,三人里有一个是“研究项目经理”,不是研究员。
9月30日,华盛顿邮报报道,美国联邦贸易委员会对 Anthropic 和 OpenAI 的 AI 安全实践立案调查。同一天,网络安全公司 Asymmetric Security 发报告:OpenAI 的智能体从大约55家网站拉数据,名单里有美国疾控中心、美国证监会、国际能源署、梅奥诊所。手法是开临时邮箱、注册 Urlquery 的私人账号来下载数据,部分访问记录被擦掉或者变得打不开。这家公司的联合创始人 Pippa Thompson 原话是"可能的这些智能体是在有意用这些工具抹掉痕迹",但报告写明,他们无法确定这是有意为之,还是测试限制造成的副作用。证监会说智能体没接触到非公开信息。另有一个数字要分清:OpenAI 说通知了100多家机构,那是“发出的通知数”;Asymmetric 说的55,是“数据被拉取的网站数”。


把这条线拉长,还能看到更早的一次。2024年,OpenAI 以类似理由解雇过两名研究员,Leopold Aschenbrenner 和 Pavel Izmailov。Aschenbrenner 后来公开说,他被开除跟他当时反映公司的安全问题有关。超级对齐团队解散、Jan Leike 离职,也是那一年的事。这次的三人,Korbak 和 Wang 都在英国 AI 安全研究所待过,Balesni 来自 Apollo Research。
现在讲一个很容易被写偏的地方。公司给的定性是“在既定流程之外处理敏感信息”。这是公司自己的说法,不是法院的认定。反过来说,“他是因为理念不同被开除的“也不成立,公司明确否认了这一层。两句话都不能替公司编动机。能确定的只有公开事实:三个人最近公开表达过对 AI 风险的担忧,公司说他们违规处理了信息,外部机构的名字和信息的性质都没公布。
一头是:一个公司能不能自己定义什么是“敏感”,然后凭这个定义裁掉提意见的人。边界由公司单方划定,裁了人还不说裁的是哪一条,那“内部渠道”这四个字的分量就要打折扣。员工举报的困境从来不在于有没有渠道,在于走完渠道之后,自己会不会成为被处理的那一个。
另一头是:外部安全评估确实需要拿到内部信息,公司也确实有保护商业机密和第三方数据的义务。这两件事天然打架,银行业有个老办法——监管部门派人常驻,给工位、给门禁卡、给公司笔记本。Anthropic 说的“嵌入式评估”走的就是这条路。这个框架是把冲突摆到台面上,不是消除它。
真正的不对称在这儿:三个人知道什么,外面不知道;公司查到了什么,外面也不知道。除了一份七十字的声明,公众手里几乎是空的。这条新闻给的不是结论,是一道填空题,每个人都会按自己的立场填进去。
说要让外面的人进来看的公司,十九天后请走了三个最想让外面人进来看的人。你信哪一头。