众力资讯网

轻量化低成本!中国AI木马屠城,美国大模型正从内部被各个击破

7月中旬开始的三周里,三款国产大模型接连上线海外,节奏卡得很准。7月16日,月之暗面Kimi K3;7月31日,深度求索

7月中旬开始的三周里,三款国产大模型接连上线海外,节奏卡得很准。7月16日,月之暗面Kimi K3;7月31日,深度求索DeepSeek V4-Flash;8月3日,阿里通义Qwen3.8-Max。海外的反馈也快,评测榜单和第三方调用平台的数据一路往上走。

但这些模型凭什么在几周之内被硅谷初创、华尔街加密平台、旧金山外卖巨头接连采用?国产开源模型这波集中出海,又会怎么改写行业的路线和玩法?

三周三款上线

7 月 16 日月之暗面正式上线 Kimi K3,这款总参数 2.8 万亿的 MoE 混合专家大模型上线当日便拿下 Frontend Code Arena 前端代码盲测 1679 分,同期表现优于 Claude Fable 5、GPT-5.6 Sol两大海外旗舰模型,在主流旗舰模型中,位居首位。

上线不到24小时,调用申请和新用户注册直接把预设的算力集群顶到红线,运营方临时收紧订阅入口,先扩容。

Kimi K3这波“爆单”,真正的意义不在于分数超过谁,而是让全球一大批中小开发者第一次直观感受到,国产开源大模型的性能扛得住。

7 月 31 日轮到 DeepSeek,V4-Flash 0731 版本用的是 2840 亿总参数、130 亿激活参数的稀疏架构;其前代 V4-Flash 0423 版本曾在 OpenRouter 聚合平台创下单周 Token 调用总量约 7.2 万亿、登顶当期榜单的成绩,本次 0731 新版上线初期该平台单周调用量约 3.45 万亿。

但我想说清楚的是,OpenRouter只是众多聚合渠道之一,这个数字是该平台口径,不能等同于全网规模。

OpenRouter 平台官方标价输入 0.14 美元 / 百万 Token、输出 0.28 美元 / 百万 Token,该渠道定价大致仅为同平台 Claude Fable 5 标价的十分之一。

Artificial Analysis 在同等标准化 Max Effort 实测工况下,V4-Flash 输出速度可达 113 tokens / 秒,相较同期 Claude Opus 5 的 74 tokens / 秒提速超 50%;虽综合智能得分低约 20%,但文案改写、简单代码、基础检索这类日常活,够用而且是好用的。

硬件门槛也降下来了,FP4与FP8混合量化后的权重体积约160GB,配上量化优化和调度适配,高端消费级独显能跑本地推理,入门显卡想扛生产级业务,还是不现实。V4-Flash真正的杀伤力,是把私有化部署的硬件账单压到中小机构能负担的区间,那些数据不能出内网、又养不起大型数据中心的公司,有得选了。

8月3日,阿里通义发布Qwen3.8-Max。Frontend Code Arena打了1668分,该模型为 MoE 稀疏架构,总参数约 2.4 万亿、激活参数 950 亿,当期第四。文本、代码生成稳在全球第一梯队;多模态图文解析、科研文献处理也进了前列,综合调用价格大约是Claude Opus 5的四分之一。

三款产品分工分别是:Kimi偏超长上下文和多模态前端;DeepSeek主打稀疏架构和本地离线部署;通义Qwen吃的是政企办公、多语种商业文案。各站各的位,从技术展示过渡到规模化试用。

海外企业选它是有原因的

为什么海外企业愿意把生产流量切过来?我看的核心就三点:成本、部署、生态。

旧金山有家叫Lindy的初创公司,做邮件自动化、日程管理、CRM这类活。6月26日,创始人Flo Crivello对外宣布,把公司全部常规生产业务的流量切到了DeepSeek-V4上。他在 NPR 公开采访中表示:AI API 的订阅费长期占运营成本很高的比例,换模型是常规的成本结构调整,不是被逼到墙角。

这里有个细节值得说一下,Lindy走的不是国内官方API,而是通过美国本土云厂商AtlasCloud托管开源权重,云服务商按商用授权协议向深度求索付费,这种模式在全球开源圈是家常便饭。

Coinbase的玩法更精细,这家加密交易平台搭了一套AI智能路由的分层调度:工程师日常研发、基础文本处理这类低风险任务,优先走Kimi K2.7、智谱GLM5.2这些国产开源;只有量化风控、高精度收益测算这些真正核心敏感的业务,才保留海外闭源模型兜底。

公司内部数据显示,整体API采购成本降了大约50%,91%的日常研发不用切回海外模型,体验没啥割裂感。

DoorDash那边,把客服问答、订单文本解析、简单脚本这些高吞吐的标准化活儿接进了Kimi。Airbnb在客服对话、多语种房源文案、用户评价分析等环节,启用了通义Qwen系列,核心风控、资金结算这些命根子业务,还是原来那套跑得很稳的模型,只在非核心业务上做了成本优化。

OpenRouter 统计面板的数据也能说明,2025 年上半年该平台国产大模型调用 Token 占比低点仅 4.5%;到 2026 年 7 月,单周峰值已突破 46%,自 2025 年中以来实现量级式抬升。但OpenRouter只是一个平台的口径,不能直接推成美国全境企业AI调用的整体渗透率。

云厂商这边动作也齐了,微软Azure、亚马逊AWS、谷歌云,还有英伟达的NIM服务,相继在自家生态里上架了DeepSeek、通义Qwen系列的开源模型托管,云厂商用自己的算力承接客户的本地化部署需求,属于全球云生态的常规布局。

我们再来看看部署, 美国现行的AI安全审查体系对定制化的闭源商用模型监管很严;开源权重交给企业自己在本地做私有化部署,这个模式不在高强度专项审查范围里,反而契合当地合规要求。

金融、咨询这类对数据保密有硬要求的企业,既不想调用第三方云端API让数据跑出去,又付不起传统巨型模型私有化部署的硬件成本。DeepSeek V4-Flash的企业级私有化整套落地,能控制在百万元人民币区间;科研个人调试的部署,几万块就能搞定,全程内网离线,数据不出服务器。

英伟达CEO黄仁勋此前公开肯定过优质开源大模型的价值,因为轻量化开源模型把AI落地门槛拉低,大量中小企业和独立开发者会入场做本地部署,直接拉动高端算力显卡的需求。作为全球核心算力硬件的供应商,行业整体AI渗透率上来,对自己的业务是利好的。

最后是生态, 三款主流国产模型都开放基础权重,全球开发者可以拿来自主二次微调、场景适配、功能改造,海外闭源模型大多只开放API调用,底层动不了,这个差别直接决定了迭代速度,V4-Flash上线一周,全球开发者提交了两千多项优化建议,细分场景的短板补得很快。

国内同行之间也在互通有无。深度求索开源的DeepEP、FlashMLA、FP8高效训练方案,行业免费用;Kimi K3引入的MLA多头隐注意力优化了超长上下文的显存占用,深度求索也吸收了Kimi的Muon优化器,来提升万亿级MoE模型训练的收敛效率。

中美两条路线各有各的活法

国产开源模型的性价比不是单纯低价让利。往底层挖,是稀疏MoE混合专家架构那套东西终于熬出头了。走的这条路,跟海外头部厂商偏重堆算力、上稠密大模型的路线完全不一样。

MoE的理念其实1991年就有人提出来了。2017年谷歌把稀疏门控MoE的基础框架搭起来。传统的稠密大模型,运行时全部参数一起参与计算,模型越大,算力消耗越夸张。

MoE的思路是把整个模型拆成很多个细分领域的专家网络,配一个门控调度系统,每次输入进来只激活对应领域的少数几个专家做计算,其他网络休眠。理论上,既能有超大参数量的知识储备,又能把单次推理的算力消耗压到很低。

在硬件资源受约束的前提下,深度求索这些年一直在死磕自家的DeepSeekMoE优化体系,细粒度专家拆分,把常规网络单元切成64个小型专家,路由划分更细;设置固定共享专家一直激活,存通用常识,从根上缓解坍缩;不用谷歌原生那套辅助损失做负载均衡,改用专家偏置参数;配上自研MLA多头隐注意力,大幅缩减超长上下文场景的KV缓存占用。

V4-Flash在这个基础上又加了CSA压缩稀疏注意力和HCA重度压缩注意力交替架构。这个设计有点意思,模拟的是人类记忆筛选的逻辑,长上下文里留住关键信息,弱化冗余。实测数据显示,百万Token超长上下文场景下,单Token的计算量只有前代V3.2的10%,KV缓存占用降到7%。上下文越长,算力节约越明显。

训练层面配套了GRPO强化学习和在线策略蒸馏的双阶段优化,把多领域专家能力融合到位。复杂指令实操的得分从61.8提到82.7。轻量化模型的实际业务能力,就是这么一点点抠出来的。

海外头部厂商长期走稠密大模型路线,靠海量算力堆规模。行业机构测算,2025 年全球超大规模云厂商数据中心资本开支约 4100 亿美元,2026 年将升至 7250 亿美元,其中绝大部分资源倾斜用于 AI 算力建设;

高盛预测,2025–2030 年四大超大规模云厂商 AI 相关基础设施累计投入约 5.3 万亿美元。美国市场是投入核心区域,整体重资产投入体量巨大,与国内轻量化架构路线形成鲜明反差。

反观国内 AI 算力整体投入规模显著低于美国。靠架构优化把算力利用效率抬起来,在绝大多数通用场景实现了性能对标。市场竞争的反作用力也直接。7月30日,OpenAI下调了GPT-5.6基础档位的调用价格,轻量化档位降幅大约八成。

OpenAI 及合作方近两年在 AI 算力基础设施投入规模巨大,稠密重资产模式下大幅降价之后,回本周期就拉长了。行业开始重新审视,单纯堆算力这条路还能不能这么走下去。

Anthropic、OpenAI之前曾尝试游说当地监管出台限制海外开源模型的相关条款。近两百家硅谷中小企业联名致信白宫表示反对,理由是限制措施会直接抬高自家AI运营成本,挤压初创企业的生存空间。

英伟达联合多家科技企业也反对一刀切式封禁,核心诉求是维护全球AI产业链的正常流通。各方表态,本质上都是立足自身商业利益的理性选择。封闭管控这条路,行业各方基本达成共识,不太走得通。

两种技术路线,慢慢走向差异化互补。海外闭源稠密大模型稳定性强,适配高精度医疗诊断、前沿基础科研、高合规金融风控这些高附加值场景;国内稀疏轻量化开源模型性价比突出,适合海量标准化日常业务、边缘端硬件部署、中小企业普惠数字化。二者不是非此即彼,共同丰富全球AI产业的供给。

全球AI行业早就告别了单一技术路线垄断的阶段,开放、竞争、互补是长期趋势。国内AI产业在外部客观约束下坚持算法创新和工程深耕,走出了一条适配自身资源禀赋的普惠化路径。靠持续的技术打磨和规范化的全球商业合作,会继续给全球数字化转型提供高性价比的方案,让AI从少数大企业的专属工具,变成更多行业都用得起的基础设施。

信源:OpenRouter平台调用统计、Artificial Analysis模型评测报告