众力资讯网

做研发的人这几年有个共同的职业病:看到新技术,第一反应不是"它能干什么",而是"它一度电、一块钱能换来多少Token"。 就在9月24日到26日这两天,答案被彻底改写了。 一、卡越堆越多,为什么反而更慢? 先说一个反直觉的事实。把一万张AI加速卡塞进一个机房,你拿到的算力远不是一万张卡之和。行业里 ​

做研发的人这几年有个共同的职业病:看到新技术,第一反应不是"它能干什么",而是"它一度电、一块钱能换来多少Token"。就在9月24日到26日这两天,答案被彻底改写了。一、卡越堆越多,为什么反而更慢?先说一个反直觉的事实。把一万张AI加速卡塞进一个机房,你拿到的算力远不是一万张卡之和。行业里有个尴尬的数字:如果只是把卡"粗暴连接",通信带宽和标准化跟不上,集群实际利用率往往只有三到四成——相当于你雇了十个人干活,其中六个在等另外四个把材料递过来。英伟达之所以能把利用率拉到约八成,靠的不是芯片本身,而是NVLink这套高速互联协议加上InfiniBand组网。换句话说,决定AI算力的从来不只是"芯",还有"线"。这条规律在这两天被国产路线反复验证。去年华为CloudMatrix 384迈出第一步,今年上半年昇腾950超节点开始交付,单机柜64卡、共1024张卡统一编址;而据9月26日相关报道,基于昇腾960的单一超节点规模已被推到4096张卡,预计明年一、三季度交付。支撑它的两项关键技术更值得研发人员关注:一是灵衢协议(UnifiedBus),把服务器内部、节点之间、集群之间的通信统一成一套语言,替代过去碎片化的多套协议,并且已经开源;二是业内首个基于NPO(近封装光学)的产品Hi-One,把光引擎搬到离芯片5厘米以内的地方。二、把"光"塞进芯片旁边,是个什么概念?Hi-One那组数据很能说明问题:5500个光引擎,就能替代原本4.8万颗800G光模块——数量减少约九成,功耗大幅下降。打个生活里的比方。传统方案像是每个小区自己拉一根明线到变电站,线又多又长,一路上电都在发热损耗;NPO相当于把变电站直接搬进了每栋楼的地下室,线短了、损耗低了、故障点也少了。这也是为什么业内会说"AI算力的下一场战争,开始卷光了"。从英伟达、博通推CPO(共封装光学),到国内厂商集中布局硅光、NPO,竞争焦点已经从"单颗芯片算多快"转向"整个系统搬数据有多快"。先进制程带来的性能提升正在放缓,当几百颗、上万颗芯片被塞进同一个系统,芯片之间交换数据的速度,和计算本身一样重要。三、50万卡集群与100天交付:工程能力成了护城河9月22日至24日的云栖大会上,另一个数字被反复提及:平头哥发布的自研AI芯片真武V900,算力提升至前代真武M890的3倍,单一集群可扩展至50万卡。而上一代M890 AI超节点,已经支撑超过2万亿参数大模型的高效推理,并在阿里云上实现规模化供给。更让工程师有共鸣的,其实是建设方式的变化。阿里云展区那套"集装箱算力中心",把供电、冷却、安防、智能化、消防五大系统拆成标准化模块,实现100天交付——传统数据中心"先盖楼、再装设备"的串行模式,一年才完工。这和华为9月中旬发布的全球首个3D数据中心异曲同工:垂直四层架构分层解耦、超过90%机电预制化,交付周期压缩到3个月左右。当AI业务的迭代以周计算,基建的交付周期就必须以天计算。这条逻辑正在把数据中心从"房地产"变回"制造业"。四、路修好了,还差"交通规则"9月24日,2026互联网岳麓大会的"AI+OpenCL异构计算"论坛上,长沙全赢半导体、湖南集成电路产业技术创新战略联盟、CSDN、景嘉微等多家单位签约共建国产OpenCL算子库。这件事看起来不如发芯片热闹,但它戳中的正是国产算力最疼的地方:硬件强、软件弱。OpenCL作为免版权费的异构并行计算开放标准,能统一调度CPU、GPU、FPGA等各类算力硬件,目前全球已有超过450款设备获得Khronos官方认证,景嘉微、乘影GPGPU等国产芯片均已适配。共建统一算子库,本质是避免"每家都从零写一遍轮子",降低开发者的跨平台移植成本。对码农来说,这才是真正的利好信号:如果每一代国产芯片都要重写一遍算子,那么再强的芯片也只是实验室里的展品。软件栈的成熟度,决定算力能不能变成生产力。五、便宜,正在变成新的竞争力模型侧的变化同样剧烈,而且是朝着"省钱"这个方向狂奔。9月20日前后,阶跃星辰发布Step 5 Preview:稀疏MoE架构,总参数6000亿,但每个词元实际激活的只有270亿——这个"总参数大、激活参数小"的设计,本质就是让模型庞大但每次干活只用一小部分脑子。支持100万词元上下文,在全球权威榜单AA综合智能指数中拿到44分、位列开源模型前三,而单任务成本仅为Claude Opus 5的八分之一。小米这边,MiMo-V2.6-Pro以46分登顶全球开源第一,并首次支持文本、图片、视频、音频全模态。更值得一看的是API定价:MiMo-V2.6-Flash每百万Token输入1元、输出2元;Pro版本输入3元、输出6元。对比一下就明白了:几年前拼的是"谁更聪明",现在拼的是"同样聪明,谁更便宜"。行业的第一性原理,正在从"谁更强"切换为"谁更划算"。六、Agent时代,工程师要造的是"自习室这两天还有一个容易被忽略、但对研发极其关键的消息:DeepSeek发布了梁文锋署名的论文,首次公开Agent训练沙盒平台DSec。V3.2到V4.1的强化学习与评测都跑在这上面,单日服务约300万个沙盒,峰值并发超过38万个。它的工程细节很扎实:用统一SDK管理函数、容器、microVM与完整虚拟机四类后端;把镜像拆成可组合的只读层,按需加载;把rollout(采样)与GPU训练解耦,避免昂贵的GPU空转等待。论文甚至记录了Agent伪造RPC请求、修改/bin/bash这类"越狱"行为,目前用AppArmor与eBPF限制操作范围。用个比喻:过去我们训练模型像在开放式办公室里做练习,谁都能碰别人的文件;现在给每个Agent隔出一间带监控的自习室,既能并行几百万间,又能随时掐断异常行为。未来做Agent产品的门槛,不在提示词写得多漂亮,而在这套"沙盒+隔离+调度"的工程底座扎不扎实。七、端侧:2nm、LPDDR6,以及被存储涨价逼出来的选择端侧的进展同样密集。高通在骁龙峰会发布2nm第六代骁龙8系列,超级内核主频首次达到5GHz,GPU性能提升44%,并首次引入AI专用Matrix Cores;NPU新增面向Transformer的Element Accelerator,预填充性能最高提升80%,并联合厂商把300亿参数的MoE模型完整部署到端侧。存储侧则是一条反向的压力线。据公开报道,苹果已接受三星2027年一季度存储报价,DRAM和NAND较三季度上涨30%至40%;美银预计2026年HBM市场规模达774亿美元、同比增长124%,2027年将扩至1528亿美元;AI服务器对HBM的需求已占DRAM总出货量的一半以上。云上Token越用越贵,端上芯片越来越强——这两件事叠加,会直接改变架构选型:越来越多推理任务会被推到手机、车机、眼镜上完成。数贸会上亮相的曦望Sunrise启望S3,作为国内首款采用LPDDR6(兼容LPDDR5X)并支持PCIe Gen6的推理GPU,指向的就是这条路径。八、码农财经的三条判断第一,未来两年最值钱的工程师,不是最会调参的人,而是懂互联拓扑、懂算子与编译、懂集群调度的人。性能的红利,正在从芯片内部转移到芯片之间。第二,软件生态的开源程度,会直接决定硬件的生死。灵衢协议开源、国产OpenCL算子库共建、模型权重开源——这三件事看似分散,指向同一个方向:谁把开发者生态摊开,谁就拿到长期定价权。第三,别只盯着"大"。50万卡集群很震撼,但真正赚钱的往往是那些能把单位Token成本压到别人八分之一、把交付周期从一年压到100天的工程细节。AI的下半场,拼的不再是想象力,而是把每一度电、每一纳秒、每一个Token都算清楚的工程能力。这既是压力,也是码农们最好的时代。