众力资讯网

嘲笑华为新AI大模型, 是看不清华为在中国AI产业和英伟达地位

昨天,2026年7月31日华为开源盘古5050亿参数的openPangu-2.0-Pro模型(模型权重、基础推理代码)及

昨天,2026年7月31日华为开源盘古5050亿参数的openPangu-2.0-Pro模型(模型权重、基础推理代码)及技术报告正式开源上线。而且,华为把盘古5050亿参数的openPangu-2.0-Pro开源了,模型权重、推理代码和技术报告都一起放了出来。然后网上就开始了,有人说华为这是看Kimi K3火了、DeepSeek V4 Flash刚发,赶紧蹭热度赶工出来的。参数也不够大,价格还高,没什么性价比。有人还翻旧账,说当年盘古大模型刚出来的时候法国气象局都觉得好,还接入用于气象预测,现在怎么这么拉胯。

确实,参数上,华为openPangu-2.0-Pro总参数量505B,MoE架构,激活参数18B,路由专家384个,每个Token路由8个专家,上下文512K,残差结构4路mHC,MTP3个预测头。训练数据34T Tokens。官方自己在技术报告里也说了,复杂真实软件工作流这块和第一梯队有差距。从两边都公开的测试项目看,大概在DeepSeek-V3.2这个级别,比GPT-5和Claude Opus4.5弱一些。

但是,仔细琢磨,你会发现这是有原因的,余承东之前说过一句话,华为AI算力芯片大量支持了国内其他企业需求,自己留的数量非常有限。这不是客套话。

华为现在中国AI生态链的位置跟英伟达在美国AI生态是差不多,主要是卖芯片、卖AI硬件、卖算力。昇腾950系列2026年950PR规划产量大约80万片。这80万片要分给麒麟、凌霄、天罡这些业务,昇腾能分到的就是其中一块。而且分到之后,海思拿到卡还得优先供给DeepSeek和GLM,这两家都公开说了下半年要大规模用昇腾950。所以华为肯定要对这些友商投桃报李。

前阵子DeepSeek投资人会议录音流出来,梁文峰的原话是这么说的:DeepSeek跟华为合作拿了一万六千张950卡,相当于四千张B系列,做不了下一代模型,但足够帮华为把生态跑通。他还说华为的问题是产能不是技术,四张华为卡顶一张英伟达卡。另外他还抱怨了一句,昇腾950大头给了互联网大厂,DeepSeek只拿到一万多张。可见华为产能多么紧张,deep seek他们多么大的怨念。

实际上,英伟达也有自己的大模型Nemotron系列,但从来不在LLM排行榜上争位置,就是小范围服务自己硬件测试。道理一样,你是卖铲子的,不能自己下场挖矿把矿工都得罪了。华为如果把盘古做得太强太便宜,那些正在大规模采购昇腾950的互联网大厂和AI公司怎么想。

openPangu-2.0-Pro技术上有几个点:Attention架构用高效MLA,DSA+SWA独立分层混合,层配比1比2,SWA层做局部窗口建模,DSA层做稀疏全局聚合。拓扑架构把传统残差连接改成4支流mHC架构,自投机模块用3头MTP,一次额外预测3个token。训练用了Muon优化器,昇腾原生训练效率提升了30%。用的重复DSA到SWA到SWA的结构,大概1层稀疏全局注意力配2层滑动窗口注意力。

当然,还有一个很重要的地方是,这次盘古模型是换血之后的第一个版本,训练时间不够多,完全基于昇腾NPU训练,不依赖英伟达生态,开源。意义就在这,证明昇腾能跑大模型,给生态伙伴提供参考,告诉外界不靠英伟达也能训出接近SOTA水准的模型。等后面算力上来了继续迭代,至于现在被说参数不够大性能不够强,那是华为自己选的,不是它做不出来。就像梁文锋说的,美国AI也好,英伟达芯片也好,其实技术上并没有什么秘密,时间够了就可以追上来,现在是美国极端封锁下,我们走出来一条新路子,这已经很了不起了。