*7月13日,上海一家成立不到三年的公司用14nm工艺造出了一颗520TFLOPS的AI芯片,没用EUV,没用HBM。
先讲清楚技术层面发生了什么,这颗芯片的名字叫Weiling——和蔚来汽车的芯片是同一个名字,但不是同一回事。
上海这家公司在去年七月的公开活动上展示了实测:他们用一颗14纳米的芯片跑LLM推理,算力标称520 TFLOPS。
台积电今天的主流AI芯片用5纳米、3纳米、搭配HBM高带宽内存,这几乎是行业标配,那14纳米意味着什么?14纳米是2015年前后的工艺节点,现在基本被视为成熟制程,中国大陆的SMIC可以自主量产。
HBM(高带宽内存)是英伟达A100、H100、B200这些高端芯片上的标配,把多个DRAM堆叠在一起,带宽极高。这家公司没有用,用的是普通的DDR5内存。
所以第一个核心矛盾已经摆在面前了:一家成立不到三年的团队,用相对成熟的工艺和普通内存,做出了一个纸面算力和入门级GPU接近的AI推理芯片。
这听起来像是一个技术奇迹,但如果只看纸面数据就下结论,容易忽略几个重要的结构性约束。
我仔细看了他们公布的性能细节,这个“520TFLOPS”不是随便测出来的,他们特别标注了这是BF16(一种16位浮点格式)下的理论峰值,而且主要针对某些特定结构的神经网络做了硬件优化。
换句话说,这个数字不是你买回去插在服务器上任何DNN任务都能跑出来的,它是有前提条件的。
那这个团队为什么要走这条路?我接触到的产业信息告诉我,中国AI芯片设计者目前面临一个很现实的困境:海外7纳米以下的代工通道基本被切断,国内先进制程产能和技术仍然在爬坡阶段。
如果他们非要用5纳米去PK英伟达,那就得面对三年以上的设计周期和几乎不可能的投片机会。
而用14纳米走一条“架构取胜”的路,逻辑上说得通,把处理单元的密度堆上去、通过改进数据流近计算来减少对存储带宽的依赖、在软件层面针对有限场景做极致优化。
这种做法在学术界叫“近数据计算”或“存算一体”的一个变种,不是天方夜谭,但以前没人敢用14纳米做这么大算力的产品量产。
但是得说清楚,这里面的代价很大,英伟达的H100用HBM3内存,带宽超过3TB每秒,这种上海芯片用的是DDR5普通内存,带宽只有几十GB每秒。一个数量级以上的差距。
他们选择把更多的计算单元集成到芯片内部,牺牲外部存储带宽带来的灵活性,这个做法的直接后果是:这颗芯片非常适合某些特定的推理模型,比如NLP类、特定结构的Transformer,但你要在上面跑图像识别、多模态模型或者自适应算法,效率就会大打折扣,它不是一颗通用GPU的替代品。
我得承认,这个团队在产业策略上是聪明的,他们没有去做和英伟达正面竞争的产品,而是瞄准了中国大量存在的“AI部署落地”场景——很多企业不需要训练千亿参数的大模型,只需要在一个相对封闭的环境里跑已经训练好的模型,成本敏感、数据还要本地保存。
这块市场里,用H100的价格去买一台服务器做推理明显不划算,而x86服务器加普通GPU的方案功耗和散热都不理想,一个专门为推理优化、能用国产14纳米制造的芯片,正好切入这个缝隙。
反对者的观点也有充足的理由,最有力的质疑来自软件生态,英伟达之所以难以撼动,不是因为硬件绝对领先,而是因为CUDA生态拥有全世界的AI开发者、框架和库。
这颗上海芯片必须让客户从英伟达的生态迁移过来,这是一个巨大的转换成本,尽管这家公司声称他们兼容主流框架,但所谓的“兼容”通常是接口级别的,真正需要落地的场景里常常会遇到各种算子缺失、性能不一致的问题。
这是一个拿一个城市的路网和全国级高速公路网做比较的问题——技术上是通的,走起来很慢。
另一个限制条件需要说明白:这家公司的芯片目前只做了推理,不是训练,AI训练需要大量的前向和反向传播计算,对矩阵运算、精度和内存带宽要求极高,这恰恰是14纳米+DDR5组合最吃力的地方。
这些数据到目前为止都是国内某个场景下的基准测试,还没有大规模第三方独立评测,这在技术上没有问题,但意味着所有讨论都还处在“理论上”和“样片表现”的阶段。
从产业角度来锚定这个事件的价值,我认为,这件事真正有意义的部分,不在于“技术指标有多强”,而在于证明了一条清晰的替代路径存在。
中国半导体行业过去三年走了一轮“用先进制程对标国际前沿”的路,结果在出口管制下频频受阻。
接下来要关注什么?我认为有三件事:第一,这款芯片是否真的能拿到量产订单,而不仅仅是实验室样品。
第二,软件工具的完整度和开发者接受度——后者才是让它真正产生实际商业价值的关键;第三,这家公司是否会被更大的国内AI服务器厂商收购或合作。
如果这三件事能走到第二步以上,这个案例对整个中国半导体设计行业的启示意义就会大过一个创业公司的个体故事。
