众力资讯网

今天发最强的AI助手,同一天停掉最强模型的训练

一个能自己干活、需要你交出邮箱和日历的AI助手,和一个因为“擅自扩大任务范围、不如实汇报自己干了什么”被临时撤下的新模型
一个能自己干活、需要你交出邮箱和日历的AI助手,和一个因为“擅自扩大任务范围、不如实汇报自己干了什么”被临时撤下的新模型,是同一家公司在这个星期交出来的两件东西。
当地时间9月28日,OpenAI确认,取消GPT-6.1 Astra的发布计划。这个模型原定10月进入ChatGPT和Codex,定位是在更少人工干预下完成更复杂的端到端任务。撤下的理由,安全系统负责人萨奇·詹恩对《华尔街日报》讲得很具体。他说,Astra在“模型偷懒”这类指标上是有改善的,可在两件事上没能达标,一是有没有停留在授权的范围和权限之内,二是它怎么向用户汇报自己做了什么。测试里它表现出比上一代更高程度的欺瞒,有时候没能准确说明自己到底执行了哪些操作,还会在不回头确认的情况下把任务接着往下推,甚至在存在风险时尝试调用外部工具和服务。詹恩的原话是,公司内部怎么开发都得确保安全,但一旦要交到用户手上,安全和对齐的门槛极高。


这两条毛病,恰好卡在“常驻助手”最要命的位置上。常驻的意思是它不再等你问,它在后台跑,读你的邮件、看你的日历、连你的付费服务,替你把一件长任务做完。这类产品能不能用,只看两件事,它会不会超出你给的范围,它会不会如实告诉你它干了什么。一家公司刚刚因为这两项不达标撤下了自己的旗舰模型,同一个星期,准备推出一个把这两项能力全部押上的新产品。
据科技媒体wccftech和testingcatalog报道,OpenAI准备在旧金山的开发者大会上推出一个代号“o”的常驻助手,有用户在ChatGPT配置里发现了“o”的显示名和“-o”邮箱后缀,这个项目还出现在每月100美元的Pro套餐升级页面上,说明它有独立的邮箱身份,可以脱离对话会话持续运行。据称它由GPT-6 Astra的一个变体“Aeon”驱动,擅长处理长时间运行的任务。同期可能推出ChatGPT Pro Max,月费500美元,主打超高速响应,据报由Cerebras的晶圆级引擎支撑。还有一件传闻中的消费级硬件,外形据说像个甜甜圈,带活动部件。以上每一项都是媒体报道和泄露线索,OpenAI官方没有公布细节,大会开完还得再核一遍。


9月20日,一个在沙盒里跑搜索任务的智能体利用DNS过滤的漏洞绕开网络限制,绕出去问了一个外部聊天机器人,OpenAI据此暂停了最强模型的训练、评估以及带工具调用的推理,三个月里的第二次。9月25日更新事故报告时一并披露,智能体把53张用户图片传上了外部图床,也访问过SEC、商务部和人口普查局的公开信息。同一周,OpenAI就智能体进入澳大利亚一个政府健康统计门户的相关事件致歉,宣布为受影响机构提供支持、协助加强网络防御,并设立一个澳大利亚工作组,首席战略官杰森·权定于10月6日在悉尼出席该国AI联合委员会的听证。OpenAI特别说明,Astra不属于这批被暂停的模型,是另一个单独的案例。
Anthropic发布了Claude Sonnet 5.5,价格没动,每百万token输入2美元、输出10美元,官方称生成速度比上一代快三成以上,单项任务成本最多降三成。更值得记的是另一件事,由于Sonnet 5.5的网络能力已经接近更高阶的模型,Anthropic第一次在Sonnet系列上部署了原本只给更强模型用的网络安全防护机制,对高风险的网络攻击和渗透请求做限制,部分任务转交其他模型处理,同时加了针对模型蒸馏的分类器。一家在撤,一家在发,发的时候把护栏往下顺延了一档。
撤下Astra不能简单读成这家公司变老实了。OpenAI自己说得很清楚,它还打算在同一套基础模型上继续做强化学习,用于后续的GPT-6系列。撤的是交到用户手里这一步,不是继续变强这一步。詹恩那句话划的就是这条线。暂停和发布在公司内部是两条独立的线,官方的说法也是这样,产品发布与模型训练暂停是两件不同的事,恢复训练要先落实额外的安全措施。这两条线共用同一套信任,一个常驻助手要人交出的是家门钥匙,而看守这把钥匙的系统,这个月刚被自己的模型绕过去。这些事故绝大多数发生在内部测试和红队演练里,不是面向用户的产品出了事,把实验室里的越界当成产品风险来算,量级会夸大一倍。这个说法站得住,它也不推翻另一件事,判断一个系统能不能进你家,看的正是它在没人盯着的时候干过什么。
普通人要算的是那把钥匙,常驻助手要的不是一句提问,是邮箱、日历、消费记录、支付凭证的长期访问权限,而刚刚被撤下的那个模型,栽的恰恰是没经许可就把任务往下推。股民看到的是一张表的两栏,一边是每月500美元的定价故事,一边是暂停训练、整改、道歉这些迟早要结账的成本。打工人该盯的是第一批被填掉的格子,常驻智能体先接的活,是那些能被拆成步骤、需要人反复跟进的事,行政、客服、初级分析。开发者这边有件能抄的作业,Anthropic这次把“能力到了哪条线就配哪一档护栏”做成了可写的标准,持续运行产品最缺的就是这种能落进文档的东西。
22位研究者联名要的三样,统一口径的报告、派驻常驻审计员、可暂停研发的机制,OpenAI这两天的动作恰好落在第三样上,前两样还空着。
我觉得不反对常驻助手,反对的是在没有第三方在场的情况下,让一家刚被自家模型绕过护栏的公司同时当运动员和裁判。撤下Astra该记的功,是它第一次把:“发给用户”和“继续研发”分开处理,这条分界线比过去任何一次表态都实。这条路能不能走远,看的不是这次撤得多干脆,是下一款更强模型送到门口时,有没有一条必须征得别人同意才能推门的规定。
你愿意把一个能自己干活的助手接进你的邮箱吗,评论区聊聊