DeepSeek正在全力训练2万亿参数(2T)的大模型,远期目标更是直接锁定在令人咋舌的8万亿(8T)。
不过,真正值得关注的并不是这个数字有多大,而是一个更关键的问题:未来AI竞争,究竟是谁拥有最多芯片,还是谁能够把有限算力发挥到极致。DeepSeek如果继续沿着高效率架构路线推进,那么它挑战的并非某一家企业,而是过去多年形成的“大模型必须依靠超级算力堆积”的发展模式。
过去几年,全球AI产业形成了一条清晰路线:更大的模型、更强的芯片、更昂贵的数据中心。但DeepSeek的发展路径并不完全相同,它更强调算法优化、训练效率和资源利用率。这个方向意味着,中国企业面对外部限制时,没有简单复制美国模式,而是在寻找另一条技术路线。
1980年代的日本半导体产业自主化竞争与本次AI算力竞争高度相似,都是面对全球技术竞争压力后推动产业链自主建设,相似点在于关键技术不能长期依赖外部供应,但关键差异在于今天AI产业不仅需要芯片,还需要软件生态、模型架构和大规模工程能力,这意味着中国AI突围面对的是更加复杂的系统竞争。
这段历史告诉我们,技术竞争从来不是单点突破,而是产业体系之间的长期较量。DeepSeek推进超大模型路线的意义,不只是增加参数数量,而是在验证中国能否建立适应AI时代的新型技术生态。
从公开信息看,DeepSeek近期并没有单纯追求参数膨胀,而是在模型结构上持续探索。2026年9月发布的DeepSeek-V4.1-Flash采用552B参数MoE架构,通过降低缓存需求、减少激活参数等方式提升效率。 这说明DeepSeek的核心竞争方向依旧是“用工程能力换取算力效率”。
如果未来2T甚至8T级模型真的进入研发阶段,那么决定成败的因素不会只是芯片数量,而是谁能把通信、存储、训练调度和模型结构结合起来。超大模型时代,算力规模只是基础,算力利用率才是决定产业竞争力的关键。
外界关注华为芯片进入DeepSeek生态,也正是在这个背景下展开。近年来,华为持续推进昇腾AI芯片和超级计算集群建设,试图通过多芯片协同、互联技术和系统架构提升大规模AI任务能力。 这意味着国产算力正在从单个芯片竞争转向整个计算体系竞争。
需要注意的是,目前关于DeepSeek利用华为芯片训练2万亿参数模型的具体细节,并没有完整公开验证。相关报道显示,DeepSeek正在建设大规模算力基础设施,并计划部署大量华为AI加速器,但报道同时指出,这些芯片主要涉及数据中心建设和模型运行等环节,与旗舰模型训练完全替代英伟达仍存在距离。 这说明国产算力路线正在加速,但产业成熟仍需要时间。
美国对中国AI产业的技术限制,也正在推动这种变化。过去限制先进AI芯片出口的做法,本意是压缩中国获取高端算力的空间,但客观上也促使中国企业加快寻找替代方案。从产业发展规律来看,外部压力往往会改变技术路线,而不是简单阻断技术演进。
DeepSeek过去受到全球关注,一个重要原因就是它证明了AI竞争并非只有“无限堆硬件”这一种玩法。当部分企业依靠大量高端GPU扩大模型规模时,DeepSeek选择通过架构优化降低成本,这种差异化路线可能成为未来中国AI产业的重要方向。
如果2万亿参数模型目标推进顺利,它带来的影响也不会只是一个模型版本升级,而是一次产业链压力测试。芯片企业需要证明国产硬件能够承担更复杂任务,软件生态需要证明兼容能力,模型团队需要证明工程优化可以弥补部分硬件差距。
从全球范围看,AI竞争正在进入第二阶段。第一阶段比拼的是谁能够获得最多先进芯片,第二阶段比拼的是谁能够建立更高效率的智能生产体系。美国企业依靠成熟生态保持优势,中国企业则试图通过自主供应链和工程效率寻找突破口。
8万亿参数目标之所以引发关注,不只是因为数字庞大,而是因为它代表一种产业想象:未来人工智能的发展,可能不再完全由少数芯片供应商决定,而是由拥有完整技术体系的一方掌握主动权。
DeepSeek推进2T模型、探索8T路线,真正重要的价值在于,它正在把中国AI产业从“追赶先进算力”带向“重新设计算力使用方式”。未来竞争的核心,不是谁喊出的参数更大,而是谁能把芯片、算法和产业生态真正连接起来。
