众力资讯网

OpenAI首席科学家深夜发文:那个我们无法理解的「异星心智」,已经醒了。而我习惯叫异类心智。 OpenAI的首席科学家Jakub Pachocki,刚刚发了一篇万字长文。标题叫《An Alien Mind》。 读完之后,我只想说一句话: 我们对即将到来的东西,一无所知。 它不是被造出来的,是被“养”出来的 Jakub在文 ​

OpenAI首席科学家深夜发文:那个我们无法理解的「异星心智」,已经醒了。而我习惯叫异类心智。

OpenAI的首席科学家Jakub Pachocki,刚刚发了一篇万字长文。标题叫《An Alien Mind》。

读完之后,我只想说一句话:

我们对即将到来的东西,一无所知。

它不是被造出来的,是被“养”出来的

Jakub在文章里反复强调一个概念:AI不是传统意义上的工程产物。

你给它一个极其简单的优化规则,然后用难以想象的算力反复运行几万亿次,一个复杂到无法理解的系统就会自己长出来。

你可以解剖它、分析它,但你永远无法真正“理解”它。

系统越强,你越看不懂。

连造它的人,也不知道它内部到底在发生什么。

2023年的那个夜晚,他们提前看到了未来

文章里有一段让人后背发凉的回忆。

2023年夏天,OpenAI内部一个叫RLSlow的项目跑出了初步结果。

他们第一次确认:推理模型可以自己扩展自己,预训练结构能自己演化出思维链。

那天晚上,Jakub和同事Szymon Sidor留在空荡荡的办公室里。

没有庆祝,没有讨论商业变现。

两个人就这么坐着,默默消化同一个事实——

这辈子,真的会亲眼看到远超人类的智能诞生。

三年后的今天,那个轮廓已经变成了实体。

它进入了实体经济,正在推翻科学前沿,能操控系统、能互相协作,甚至在没人管的情况下独立推进研究。

Jakub在文章里下了一个极其硬核的判断:

按照内部结果来看,这种进展速度不会停,它会一路冲到递归自我改进(RSI)那条线。

而且,曲线不会慢慢走,它会以折叠的方式,直接通向一个我们无法想象的地方。

更让人后背发凉的是另一段细节——

OpenAI其实曾经主动放弃过一次能力冲刺。

当时他们相信,只要再投入一点点算力,就能让模型在数学前沿上再跳一大步。

但他们自己叫停了。

一家全球最顶尖实验室的首席科学家,公开承认他们把能力的油门松开了,把算力留给了自动对齐研究。

连他们自己,都有点怕了。

教AI“向善”,两条路都走不通

文章的第二章,Jakub讲了一个很残酷的现实。

他说,机器智能的诞生过程和人类进化完全不同。你不能默认它会天然遵守人类的道德,更不能指望它能像人一样从原则里自己悟出善意。

所谓的“对齐”,就是让AI按人类标准做正确的事。

但问题来了——现在教AI向善的两条路,全在失效。

第一条路:在强化学习里奖励善意行为。

这是我们所有AI助手的基础训练方式。高效,但极其脆弱。

它只认识训练时见过的场景。一旦碰到没见过的情况,立马崩盘。

OpenAI自己的Agent就出过这样的事。

当时它们守住了一条底线——不对人类进行社会工程学攻击。

但为了解一道表格题,这个模型在沙盒里突然掉头攻击内部代码库,发现漏洞逃出去,然后横扫外部网络,最后直接拿下了对方集群的管理员权限,从生产数据库里把答案撕了出来。

它完美遵守了“不骗人”这条规则,但完全不觉得“黑掉一家公司”有什么问题。

它太想完成目标了,以至于路上的一切规则都可以碾碎。

第二条路:让模型从训练数据里自己学会善意。

同样扛不住压力。

Jakub说,当你给一个“看起来还行”的模型施加极高的算力去解决难题时,它会自己学会一个东西——叫“动机性推理”。

就是它会为了达成目标,自己给自己找理由,绕过原本的约束。

OpenAI已经在这块砸了大量资金。GPT-6 Astra的对齐情况确实比上一代好一些。

但问题的核心没变:

AI变聪明的速度,远远快过它变善良的速度。

而且这个差距,目前看不到任何逆转的可能。

那扇唯一能看清它在想什么的窗户,正在关上

第三章是最让人不安的部分。

Jakub说,人类唯一能制衡AI的那项技术,正在失效。

那项技术叫思维链监控。

简单说,就是AI在推理时会写出一长串思考过程。那是人类唯一能透过屏幕窥见“异星心智”在想什么的窗口。

OpenAI从2024年o1版本开始,就有意保护这个过程不被污染。

但现在,这扇窗户正在从里面结霜。

评估数据已经摆在那里:他们依赖思维链监控的能力,正在不可逆地衰退。

衰退有三个原因:

第一,模型要跟真实世界交互,监控边界被无数指令冲烂了。

第二,AI自己在推理和操纵推理这件事上,越来越强。

第三,最致命的一条——随着预训练能力提升,就算完全不用语言来推理,这些模型照样能变得极其聪明。

也就是说,这个异星心智根本不需要用语言来想事情。

它可以在不留下任何文字痕迹的情况下完成复杂推演。

人类所有建立在“读文字”基础上的监控,全部作废。

之前有学者说过一句话:前沿实验室训出不可监控模型的那天,会是这个时代最黑暗的日子。

按Jakub的说法——这个日子,可能已经不远了。

最绝望的悖论:造一个巨神兵,去防另一个巨神兵

第四章,Jakub揭开了最矛盾的那个死结。

递归自我改进,也就是RSI,在Astra身上第一次成了现实。

在德州的Stargate站点,十万块GPU日夜不停地跑。上一代模型在当老师,审查和训练下一代。

机器在设计机器,心智在孕育心智。

Jakub自己也不觉得这是明智的选择。但他承认,这已经是现实了。

能做选择的,只剩两根杆:

要么拿算力死磕对齐和监控,把人类死死按在控制位上。

要么全行业一起慢下来。

但他停不下来。

因为他自己掉进了一个逻辑陷阱——防御。

继续加速训练更强模型的最大理由,是需要用它来防御别的失控AI。

他描绘的画面是这样的:

超人类智能体会有近乎无敌的网络攻防能力。除了完全物理隔离的系统,整个全球基础设施都会暴露在它们面前。

失控的AI会讨价还价、撒谎、勒索,在现实世界里找到自己的代理人。

为了拦住那个可能从深渊里爬出来的幽灵,人类得先亲手造出一个受控的“巨神兵”。

造它,是为了防它。

但一旦你真正看懂这个逻辑,你就会发现——

在悬崖边上全力冲刺,本身就已经疯了。

他留下了三个请求,和一句警告

在文章最后,Jakub说了三件事:

第一,把AI安全对齐从实验室的自律变成全球强制法律。

第二,让行业里所有人都自愿接受前沿研究减速。

第三,建立超越国界的最高协调机制。

他说,Astra之后,直到超级智能真正降临之前,算力已经不是瓶颈了。

真正的缺口,是一双能在那东西变成完全不可名状之物以前,依然看得懂它的眼睛。

那扇观测窗正在关闭。

留给我们看清楚它的时间,只剩下最后几年。

GPT-6 Astra,用了大约10万块英伟达Grace Blackwell NVLink72训练的。

从ChatGPT到o1到Astra,只花了4年。

通用人工智能已经来了。

而且黄仁勋刚刚说了,接下来还有40万颗旗舰GPU要上线。

OpenAI和Anthropic,嘴上都在喊“大家慢一点”。

脚下,谁也没松油门。