今天听了一期播客。我把精华提出来了,是说世界模型。嘉宾老师我没太注意是谁,但是他的观点我很认同,他把世界模型分为三类:
第一类是视频和空间生成类的世界模型。
这里面的代表是OpenAI已经停掉的 Sora。然后Sora,Jenny和这个Marble,它们其实都是沿袭这一套的这个技术路线。那这一类模型呢,它更像是一个可以去观看,可以去探索,可以去交互的世界。
他们的优势是很多叫做视觉上面的连续性,场景生成,空间想象。比如说游戏或者很多呃类似于交互式的体验的这些领域里面会有比较长足的发展。
第二类他觉得比较有意思的是叫做具身智能和这个机器人的世界模型。
比如说physical Al或者叫物理AI的时候比较火的一些讨论。那这一类模型呢它就不仅仅只是生成视频,而是要去预测某一个特定的动作。
就像我们一开始给的定义一样,它会导致怎么样的一个结果?当我们去限制住了它的这个状态空间的时候,下一步会发生什么?像Nvidia这个所谓的Cosmos,它就是延续着这一类的叫做physical AI的技术路线,它比较贴近这一个层级的世界模型。
最后一个是工业的世界模型。
就是生成一个视频让我们看到,哇,这个东西非常酷炫,而是说要在具体的生产线、具体的管道、设备和矿山里面去预测不同的状态,它们的分布情况是怎么样然后诊断有没有一些异常。
如果说大语言模型是正在成长的儿童,那世界模型对于我来说就是一个刚出生的婴儿。这期栏目很牛的地方在于他们对世界模型有着自己的认知和判断,但是又告诉大家:这个判断不一定对。
就很合理。