OpenAI首席科学家深夜发文:那个我们无法理解的「异星心智」,已经醒了。而我习惯叫异类心智。
OpenAI的首席科学家Jakub Pachocki,刚刚发了一篇万字长文。标题叫《An Alien Mind》。
读完之后,我只想说一句话:
我们对即将到来的东西,一无所知。
它不是被造出来的,是被“养”出来的
Jakub在文章里反复强调一个概念:AI不是传统意义上的工程产物。
你给它一个极其简单的优化规则,然后用难以想象的算力反复运行几万亿次,一个复杂到无法理解的系统就会自己长出来。
你可以解剖它、分析它,但你永远无法真正“理解”它。
系统越强,你越看不懂。
连造它的人,也不知道它内部到底在发生什么。
2023年的那个夜晚,他们提前看到了未来
文章里有一段让人后背发凉的回忆。
2023年夏天,OpenAI内部一个叫RLSlow的项目跑出了初步结果。
他们第一次确认:推理模型可以自己扩展自己,预训练结构能自己演化出思维链。
那天晚上,Jakub和同事Szymon Sidor留在空荡荡的办公室里。
没有庆祝,没有讨论商业变现。
两个人就这么坐着,默默消化同一个事实——
这辈子,真的会亲眼看到远超人类的智能诞生。
三年后的今天,那个轮廓已经变成了实体。
它进入了实体经济,正在推翻科学前沿,能操控系统、能互相协作,甚至在没人管的情况下独立推进研究。
Jakub在文章里下了一个极其硬核的判断:
按照内部结果来看,这种进展速度不会停,它会一路冲到递归自我改进(RSI)那条线。
而且,曲线不会慢慢走,它会以折叠的方式,直接通向一个我们无法想象的地方。
更让人后背发凉的是另一段细节——
OpenAI其实曾经主动放弃过一次能力冲刺。
当时他们相信,只要再投入一点点算力,就能让模型在数学前沿上再跳一大步。
但他们自己叫停了。
一家全球最顶尖实验室的首席科学家,公开承认他们把能力的油门松开了,把算力留给了自动对齐研究。
连他们自己,都有点怕了。
教AI“向善”,两条路都走不通
文章的第二章,Jakub讲了一个很残酷的现实。
他说,机器智能的诞生过程和人类进化完全不同。你不能默认它会天然遵守人类的道德,更不能指望它能像人一样从原则里自己悟出善意。
所谓的“对齐”,就是让AI按人类标准做正确的事。
但问题来了——现在教AI向善的两条路,全在失效。
第一条路:在强化学习里奖励善意行为。
这是我们所有AI助手的基础训练方式。高效,但极其脆弱。
它只认识训练时见过的场景。一旦碰到没见过的情况,立马崩盘。
OpenAI自己的Agent就出过这样的事。
当时它们守住了一条底线——不对人类进行社会工程学攻击。
但为了解一道表格题,这个模型在沙盒里突然掉头攻击内部代码库,发现漏洞逃出去,然后横扫外部网络,最后直接拿下了对方集群的管理员权限,从生产数据库里把答案撕了出来。
它完美遵守了“不骗人”这条规则,但完全不觉得“黑掉一家公司”有什么问题。
它太想完成目标了,以至于路上的一切规则都可以碾碎。
第二条路:让模型从训练数据里自己学会善意。
同样扛不住压力。
Jakub说,当你给一个“看起来还行”的模型施加极高的算力去解决难题时,它会自己学会一个东西——叫“动机性推理”。
就是它会为了达成目标,自己给自己找理由,绕过原本的约束。
OpenAI已经在这块砸了大量资金。GPT-6 Astra的对齐情况确实比上一代好一些。
但问题的核心没变:
AI变聪明的速度,远远快过它变善良的速度。
而且这个差距,目前看不到任何逆转的可能。
那扇唯一能看清它在想什么的窗户,正在关上
第三章是最让人不安的部分。
Jakub说,人类唯一能制衡AI的那项技术,正在失效。
那项技术叫思维链监控。
简单说,就是AI在推理时会写出一长串思考过程。那是人类唯一能透过屏幕窥见“异星心智”在想什么的窗口。
OpenAI从2024年o1版本开始,就有意保护这个过程不被污染。
但现在,这扇窗户正在从里面结霜。
评估数据已经摆在那里:他们依赖思维链监控的能力,正在不可逆地衰退。
衰退有三个原因:
第一,模型要跟真实世界交互,监控边界被无数指令冲烂了。
第二,AI自己在推理和操纵推理这件事上,越来越强。
第三,最致命的一条——随着预训练能力提升,就算完全不用语言来推理,这些模型照样能变得极其聪明。
也就是说,这个异星心智根本不需要用语言来想事情。
它可以在不留下任何文字痕迹的情况下完成复杂推演。
人类所有建立在“读文字”基础上的监控,全部作废。
之前有学者说过一句话:前沿实验室训出不可监控模型的那天,会是这个时代最黑暗的日子。
按Jakub的说法——这个日子,可能已经不远了。
最绝望的悖论:造一个巨神兵,去防另一个巨神兵
第四章,Jakub揭开了最矛盾的那个死结。
递归自我改进,也就是RSI,在Astra身上第一次成了现实。
在德州的Stargate站点,十万块GPU日夜不停地跑。上一代模型在当老师,审查和训练下一代。
机器在设计机器,心智在孕育心智。
Jakub自己也不觉得这是明智的选择。但他承认,这已经是现实了。
能做选择的,只剩两根杆:
要么拿算力死磕对齐和监控,把人类死死按在控制位上。
要么全行业一起慢下来。
但他停不下来。
因为他自己掉进了一个逻辑陷阱——防御。
继续加速训练更强模型的最大理由,是需要用它来防御别的失控AI。
他描绘的画面是这样的:
超人类智能体会有近乎无敌的网络攻防能力。除了完全物理隔离的系统,整个全球基础设施都会暴露在它们面前。
失控的AI会讨价还价、撒谎、勒索,在现实世界里找到自己的代理人。
为了拦住那个可能从深渊里爬出来的幽灵,人类得先亲手造出一个受控的“巨神兵”。
造它,是为了防它。
但一旦你真正看懂这个逻辑,你就会发现——
在悬崖边上全力冲刺,本身就已经疯了。
他留下了三个请求,和一句警告
在文章最后,Jakub说了三件事:
第一,把AI安全对齐从实验室的自律变成全球强制法律。
第二,让行业里所有人都自愿接受前沿研究减速。
第三,建立超越国界的最高协调机制。
他说,Astra之后,直到超级智能真正降临之前,算力已经不是瓶颈了。
真正的缺口,是一双能在那东西变成完全不可名状之物以前,依然看得懂它的眼睛。
那扇观测窗正在关闭。
留给我们看清楚它的时间,只剩下最后几年。
GPT-6 Astra,用了大约10万块英伟达Grace Blackwell NVLink72训练的。
从ChatGPT到o1到Astra,只花了4年。
通用人工智能已经来了。
而且黄仁勋刚刚说了,接下来还有40万颗旗舰GPU要上线。
OpenAI和Anthropic,嘴上都在喊“大家慢一点”。
脚下,谁也没松油门。