梁文峰说:四张华为卡顶一张英伟达卡,技术上大约落后两年。
很多人第一反应是,单卡性能只有人家四分之一?那差距也太大了。其实不能这么简单算。这个“顶”,指的是实际业务场景下的等效效果。
比如跑同样的大模型训练任务,四张华为昇腾的高端卡搭配起来,不管是训练速度、最终效果还是延迟表现,基本能追平一张英伟达的旗舰卡。
不是纸面算力刚好差四倍,是真刀真枪跑通业务后的折算比例。
业内有人算过更细的账,比如华为的CloudMatrix 384超节点,用384张昇腾卡对标英伟达同级别72卡的集群,算下来比例大概五比一多一点。
所以“四张”是个通俗的约数,核心意思就是单卡有差距,但靠数量能补得上。
至于“落后两年”,也不是随口拍脑袋的数字。从芯片制程、架构迭代的行业节奏来看,英伟达当前旗舰产品对应的技术节点,华为大概需要两年左右的时间能追上。
这是硬工艺的差距,没法靠软件优化完全抹平,得一步一步啃下来。
但有意思的地方就在这,华为压根没想着在单卡性能赛道上跟英伟达死磕。
人家从一开始就走了另一条路:单颗芯片打不过,就把一堆芯片高效连起来,靠系统级的优化和超节点技术整体突围。
之前深圳河套的团队用昇腾910C集群,一个月就跑通了DeepSeek的万亿参数大模型训练。这是全球第一次在国产芯片上完成这么大规模的训练。
单看每一张卡,性能确实不如英伟达旗舰,但几百张卡高效协同起来,总算力和训练效率反而能打出优势。
搁以前,光有硬件也没用,CUDA生态就是绕不过去的高山。全球开发者都习惯了英伟达的工具链,换国产卡要重写大量代码,时间成本高到没人愿意尝试。但现在这个壁垒正在快速瓦解。
一方面是出口管制卡得死,高端英伟达卡有钱也买不到,企业被逼着找替代方案;另一方面技术本身也在拆CUDA的墙。
梁文峰自己也说,现在AI能自主写适配代码,新的编程语言也降低了算子重写的门槛,以前要几个月干完的适配活,现在几周就能搞定。
国内阿里、字节这些大厂都在深度适配华为的算力框架,生态的口子已经彻底撕开了。现在的问题早就不是“能不能用”,而是“用得顺不顺手”,差距正在快速缩小。
我自己看完这些信息,第一个感受是,终于有业内人不说极端话了。
之前聊国产AI芯片,舆论总在两个极端跳,要么是“全面超越英伟达”的吹牛皮,要么是“给人家提鞋都不配”的唱衰,很少有人站出来给个务实的判断。
有差距,但差距可量化;有短板,但短板有办法补。这才是产业发展正常的状态。不用吹得天花乱坠,也不用妄自菲薄,就实打实说清楚现状,反而最有说服力。
而且我觉得最值得琢磨的,是两边完全不同的技术路线。英伟达这么多年一直死磕单卡极致性能,把芯片越做越强,价格越卖越贵,靠着技术壁垒和出口管制躺着赚钱。
但华为走的是系统集成的路线,单颗芯片性能弱一点,就靠互联技术、集群调度把整体性能拉上来,相当于用工程能力补材料工艺的短板。
这条路以前没人看好,毕竟单卡性能的差距摆在明面上。但现在真的跑通了商业落地,就说明AI算力的竞争,未必只有单卡性能这一条评判标准。
未来大模型训练都是成千上万张卡集群作战,单卡强一点弱一点,未必有集群调度效率、互联带宽、整体供货稳定性这些因素重要。
当然也不能盲目乐观。现在国产算力最大的卡点,已经不是技术,是产能。梁文峰也直言,硬件和生态都没问题,就是产能不够。
能设计出来,能跑通业务,但是造不出来足够多的量,市场的大缺口还是填不上。这也是为什么技术上只差两年,但全面普及还要更久,产能爬坡是个慢功夫,急不来。
我反倒觉得,“四张顶一张”的现状,反而是个健康的状态。它没有靠营销吹泡沫,也没有靠情怀绑架用户,就是明明白白告诉你差距在哪,优势在哪,适合什么样的场景。
企业可以根据自己的需求选,买不到英伟达卡的,用华为的方案也能把事办了,无非是多占点机房空间,多花点调试成本。没有夸大,也没有隐瞒,这才是做产业该有的态度。
