众力资讯网

算力芯片往事-----英雄远征 深度学习革命在2012年ImageNe

算力芯片往事-----英雄远征

深度学习革命在2012年ImageNet竞赛上正式爆发,多伦多大学辛顿三人组勇夺冠军,领先第二名的准确度差距有两位数。他们的AlexNet是一个六千多万个参数、八层网络的“庞然大物”,用CPU训练耗时以月计算,而他们用两块NVIDIA GTX 580游戏显卡训练了不到一个星期。

一战成名的不仅是Alex、Ilya Sutskever和导师Geoffrey Hinton,还有英伟达GPU。AI圈子突然发现,GPU并行计算才是训练神经网络的正确姿势。好日子就这么开始了,英伟达大踏步从科技计算和游戏玩家出圈,cuDNN、CUDA生态一路狂奔,成就今天的万亿美元伟业。Hinton后来拿了图灵奖和诺贝尔物理学奖,Ilya成为OpenAI创始人和首席科学家,后来离职创业,Alex加盟英伟达继续搞深度学习优化——三条路,起点都是那两块GTX 580。

深度学习革命掀开了人工智能革命的序幕,之后五年,计算机视觉CV主导商业变现,卷积神经网络算法CNN统治一切,GPU并行计算契合卷积操作,整个行业都沉浸在“GPU就是AI算力”的共识里,没人认真想过——除了GPU,深度学习是不是还有其他硬件选择?

两年后,一篇论文彻底改变了整个算力芯片产业的发展轨迹。

2014年3月,DianNao论文获得ASPLOS获得最佳论文奖,同年12月团队续作DaDianNao论文斩获MICRO最佳论文奖。这篇论文第一次系统性地论证,为人工智能设计专用处理器DSA,完全可行而且十分必要。论文展示了梦幻般实验成果,用65nm这种老掉牙的制程,做了一颗三平方毫米、功耗四百八十五毫瓦的芯片,性能把当时最先进的SIMD处理器甩了一百一十七倍,多芯片版本比GPU快四百五十倍。这篇论文还为算力芯片指明了方向,AI加速计算的真正瓶颈不在计算在内存墙——“数据搬运”才是罪魁祸首。与其在芯片上堆硬件算力单元,不如从架构上设计好数据怎么流。 当时业界只知GPU比CPU强很多,对DSA没有任何共识。这篇论文第一次把这条路走通了。这篇石破天惊的论文有七位作者,其中一位作者Olivier Temam在2016年加盟谷歌,TPU由此而生。2017年谷歌发表TPU论文,加速计算比当时GPU快十五到三十倍,TPU成为谷歌AI云计算的硬件底牌,谷歌科学家Transformer架构也在同年问世。

2022年11月ChatGPT震撼世界,大语言模型统治AI的时代正式开启,CV智能退场,算力需求从“很大”变成“变态”,参数从亿级飙到万亿级,自注意力机制的计算,让算力芯片的数据搬运负担指数级增长。真正能够训练SOTA级别大语言模型的算力芯片,只有英伟达GPU和谷歌TPU,时至今日,谷歌的大语言模型已经落后,但是TPU集群依然强悍,Anthropic刚刚签下租用大单,要有TPU训练最前沿的模型。

2024年,ASPLOS将十年时间检验的最具影响力论文奖办法给十年前这篇DianNao论文。《自然》杂志评价他们是 “深度学习处理器的先驱和引领者”,美国《科学》杂志发文评价:“这是发生在硅谷之外的颠覆性进展”。 2025到2026,整个行业争分夺秒修的全是数据通路:HBM堆带宽、光模块提速、NVLink扩通道、超节点拉互联。当年写在纸上那个判断,十年后变成了几千亿美金的产业链。

并非所有算力厂商都理解DianNao论文的洞察,某些厂商聚焦CNN加速需求,芯片上堆满矩阵乘法单元和向量单元,算力峰值卷到飞起,忽略了矩阵单元和向量单元的直连数据通路,计算结果要先绕到共享缓存里再喂给下一级,绕来绕去直接把算力优势吃掉了。算得快有什么用?数据搬运是AI计算的瓶颈,2014年的洞察在大语言模型时代依然是铁律。 那篇DianNao论文的主要位作者是陈云霁、陈天石两兄弟。在Olivier加盟谷歌设计TPU的同一年,他们下海创办了寒武纪。2019年美国制裁落地,寒武纪被列入实体清单,先进制程产能被掐断。创业四年,营收还在爬坡,利润暴跌,被美国封堵,怎么看都是死局。

寒武纪活下来了!

底气来自两兄弟那篇论文的学术源头——从指令集到微架构全栈自研。寒武纪2020年7月及时登陆科创板,首发募了二十五点八亿。2019到2024年一直用成熟制程迭代,适配国内供应链,思元系列旗舰芯片综合性能逼近A100百分之八十,价格只有三分之一。字节、阿里、腾讯、百度的推理集群开始规模部署。2025年寒武纪营收超过64亿元,同比增长453%,首次全年盈利。新一代思元690发布,FP16算力超七百TFLOPS,国产算力芯片稳居第一梯队。2014年就洞见AI计算本质的人,值得这个时代的嘉奖!!!

如果当年没有美国制裁掐断产能,寒武纪成就未必在TPU之下。就算被“背刺”、被封锁、被掐产能,他们还是杀出来了。TPU走谷歌的康庄大道,寒武纪走的是另一条路。寒武纪2023、2024两年加起来获得政府补助不到四个亿,2025年Q1七千六百多万。这点钱不够某些厂商一个政务订单的零头。

中科院计算所群雄的生存之路从来都是靠产品力而不是靠补贴。陈氏兄弟的博导胡伟武说过,龙芯成功得益于“研发支持‘扶上马’、市场带动‘送三程’、各类社会力量全程保驾护航”。2001年到2010年,龙芯课题组花掉国家大概四个多亿。2010年创办龙芯中科时,没人相信能做成。北京工投董事长说了句话:“我知道投龙芯肯定是赔的,但是赔了也要投,因为这是国家战略。”胡伟武感慨:“如果龙芯是在硅谷,就可能跨不出这一步。” 这话放在寒武纪身上也一样,2019年三连击是灭顶之灾,科创板让他们活了下来。

回到2014年,那篇论文是大陆科研机构首次在计算机系统和高性能计算领域顶级国际会议上获得最佳论文奖,也是亚洲首次。ASPLOS创办于1982年,三十多年来,亚洲研究机构从未拿过这个奖。 同年12月,陈氏兄弟的多核深度学习处理器架构,在体系结构领域另一个顶会MICRO再次斩获最佳论文奖。MICRO创办于1963年,这是美国以外国家首次获得这个奖项。一年之内两次获得体系结构顶会最佳论文奖,在国际计算机体系结构领域中也是绝无仅有的成就。截至目前,中国大陆机构在体系结构四大旗舰会议(ISCA、MICRO、ASPLOS、HPCA)上获得的最佳论文奖,仅有这两次。

中科院计算所所长孙凝晖院士说过,计算所建所六十年,“数不出来有几个在国际上属于原创、引领性的技术,水平上最多到一点五流,但寒武纪处理器算一个”。他还说这是“变道超车”——“不跟竞争对手跑同一个赛道,而是到智能领域占领领先地位”。

这篇2014年的论文走通了从学术源头到商业落地的全链条,中国资本市场终于学会了一件事:应该把钱给到中国自己的顶级人才手里,回报就是2025年寒武纪64亿营收和首次全年盈利。

寒王归来,路是自己修的!(必须声明,讲故事讴歌英雄,不构成投资建议)