马斯克最近接受《经济学人》的那段采访,在国内 AI 圈传得挺火。
说实话,从他嘴里说出中国很有可能在 AI 领域成为领导者,这话分量还是不一样的。
毕竟他自己就是 xAI 的老板,手上握着全球顶尖的超算集群,天天跟算力、电力打交道,他看问题的角度,跟很多媒体评论家不在一个层面上。
这次他特意点了月之暗面刚发布的 Kimi K3,说印象深刻。
这不是客套话,K3 发布这十来天,在国际评测圈确实炸了锅。
2.8 万亿总参数,目前全球最大的开源模型,原生带视觉理解,还有百万 Token 的上下文窗口。
最狠的是在编程榜上,直接把 Claude 和 GPT 都干下去了,这是开源模型头一回在硬核技术榜单上超越闭源头部选手。
成本更夸张,同样级别的能力,调用价格差不多只有美国同行的一半。
很多人说中国大模型就是靠堆参数、打价格战,其实真不是这么回事。
你看 K3 用的混合线性注意力、稀疏专家架构,都是实打实的底层架构创新,在算力受限的情况下,把扩展效率提升了两倍多。
说白了,就是在芯片不如人家的条件下,靠算法和工程能力把性能拉到了第一梯队。
但马斯克真正看重的,还不是某一个模型有多强。他点出的核心逻辑是:AI 竞赛拼到最后,拼的是电力。
这个观点很多人第一次听觉得有点扯,AI 不是高科技吗,怎么跟发电量扯上关系了?
等你真了解了大模型训练的能耗就懂了。
一个顶级大模型训练一次,耗电量相当于一个小城市一天的用电量。
未来超算集群越建越大,动不动就是十万张级别的 GPU,一个数据中心就要 1 吉瓦的供电,这是什么概念?差不多等于一座百万人口城市的居民用电负荷。
马斯克自己就吃过美国电网的亏。去年他在孟菲斯建超算,需要 1 吉瓦电力,电网公司直接让他排队等一年多,逼得他自己买燃气轮机发电。
这不是个例,美国现在建数据中心最大的瓶颈已经不是芯片,是接不上电。
电网老化、跨州调度难、审批流程慢,你有钱有芯片,没电就是跑不起来。
而中国在这件事上的优势,是结构性的。现在全国发电总装机已经突破 40 亿千瓦,差不多是欧盟加美国的 1.7 倍。
去年一年新增的发电量,就超过了很多发达国家全年的总发电量。更关键的不是量大,是整个体系的调度能力。
西电东送、特高压、东数西算,这一套组合拳打下来,西部的绿电可以源源不断送到东部,算力枢纽可以建在电价便宜、气温低的地方,既能降成本又能解决散热问题。
白天用电高峰就停一停非紧急训练,夜里风电足了就全速跑,算力和电力形成了动态协同。
这种全国一盘棋的基建能力,确实是独一份的。
不过话说回来,也不能因为别人夸两句就飘了。
马斯克说中国有决定性优势,不代表现在就已经领先了。
客观讲,我们在高端芯片、基础软件生态、前沿理论研究上,还有明显差距。先进光刻机的问题,他说比大多数人想的更近,但终究还没完全解决。
现在中国 AI 公司的很多突破,其实是在约束条件下逼出来的创新 —— 芯片不够用,就想办法把每一张卡的效率榨到极致。
算力成本高,就在架构上做优化、在工程上抠细节。这种逆境中生长出来的能力,韧性很强,但也要承认起点上的差距。
有意思的是,这次马斯克还提到了机器人。
他认为未来十年人形机器人会大规模进入工作场景,整个社会的生产方式都会变。
而在机器人领域,中国的制造业优势、供应链优势只会比 AI 领域更明显。
从电机、减速器到传感器,整条产业链都在国内,成本能做到别人的几分之一。
当 AI 和机器人结合起来,算法和制造能力相互加持,这个化学反应才是真正值得期待的。
其实回头看这几年中国 AI 的发展路径,挺有意思的。不是沿着别人铺好的路往前走,而是走出了一条自己的节奏。
别人堆芯片堆算力,我们就在算法效率上找突破。
别人做高端闭源收高价,我们就靠开源和性价比快速铺开应用场景。
别人被电网和基建卡脖子,我们就用几十年攒下来的电力家底托住算力的爆发。
没有哪条路是绝对正确的,但至少我们走出了自己的章法。
马斯克的判断,更多是站在全球产业格局上的一种观察。他看到了电力这个底层变量,也看到了中国在基础设施和工程落地能力上的厚积薄发。
对我们来说,别人的肯定可以听,但不用太当回事。路还很长,芯片的坎要过,基础研究的课要补,生态的墙要筑。
AI 这场竞赛不是百米冲刺,是马拉松。
现在刚跑了几公里,谁能笑到最后,拼的不只是谁跑得快,更是谁的底子厚、谁的耐力足、谁能把技术真正落到产业里,变成实实在在的生产力。