众力资讯网

梁文峰发言全文信息太多了,能推理出不少东西字面意思大家都看,稍懂点大模型黑话,梁

梁文峰发言全文信息太多了,能推理出不少东西

字面意思大家都看,稍懂点大模型黑话,梁文锋说什么都很清楚。

一个是,DeepSeek愿景是做AGI。什么是AGI,这个就扯不清。但从发言里,能看出“持续学习”是一个关键。这个持续学习,应该就是说,大模型预训练、后训练弄好了以后,模型系数就固定了,应用过程中它实际是不学习的,能力不改变。这和人不一样,人脑随时都在改变,可以持续学习。

如果把持续学习弄出来了,这是一个划时代的进步,等于“学习”这个事,机器再也没有比人差的地方了。机器就可以学习如何改进自己,把这个循环搞通了,最后做出来的就是AGI。至于有多厉害不知道,但肯定很厉害。现在各种AGI、ASI概念本就不统一。以后应该会有多种极为强大、但各自不同的机器智能。这听上去并不是幻想,只要持续学习突破,确实就打开了空间。

至于物理AI、世界模型、具身智能,这个在梁文锋看来,应该是人的套路。就算学会了人的本事,也不是AGI,人这些本事并没多厉害,所以不是AGI的关键。

再一个,部署大模型这个事,难度被大大低估了。基座大模型的权重开源了,但是如何部署,非常难。有两个难度,一个是写编排程序,这里有很多训练者才知道的知识,如何与基座大模型配合。一个是让如何部署能节省算力,让token成本很低。这是DeepSeek的绝活,别人不会部署,成本可能高五六倍。所以,中国头部公司都不怕开源,别人抄了作用不明显,部署效率会比原生的差很多。这也是印度、日本等国拿开源的改进,没什么影响力的原因,部署都不太对劲,里面的数据结构很难玩得很顺。

关于中美差距,就只有算力了。这是业界共识了,但以前不是。以前会觉得大模型技术都有差距,美国领先多少,有哪些技术秘密没公布,还防蒸馏。现在即使中国开源大模型性能比美国的差一些,也会认为是算力的原因。如果美国只有算力优势,那等于没什么优势了,变成了工程问题,如何凑算力、限制中国算力。中国这边直接一招开源绝杀,美国算力优势,代价是成本非常高,买卡多十倍,开源让它没法回本。

而国产算力也找到了办法,华为韬定律已经定了2030年的算力目标,没有卡住。就以现在的资源,五年后应该算力问题就有中国特色的解决办法了。例如国产先进DUV光刻机以及逻辑折叠设计、先进封装技术都完全自主了,那无非就是花钱投资,算力没有上限。其实中国要搞起投资,能动员的钱远比美国多,一年固定资产投资50万亿问题不大,只是找不到值得投的。如果算力值得投,也没有卡点了, 银行体系有多种办法支持,搞到算力富余不成问题。这是钱花给自己,不是买英伟达卡到外面去了,自主可控之后,资金不是问题。