
本文仅在今日头条发布,谢绝转载。
Token工厂的兴起标志着算力租赁产业正从“资源租赁”的1.0时代迈入“智能生产”的2.0时代,商业模式从“卖卡时”转向“卖Token”。
全球智算基础设施的建设浪潮正经历着一场从“以资产负债表扩张为导向的硬件军备竞赛”向“以资本回报率(ROI)和每瓦 Token 生成效率为核心的精细化运营范式”的深刻变革 。过去三年间,全球资本市场对于算力租赁及智算中心(AIDC)的估值逻辑,高度锚定于其上游芯片供应的稀缺性以及企业资产负债表上 GPU 持有量的绝对多寡 。然而,随着硬件供应链的逐步多元化、存量算力资产的资产折旧压力摊薄以及下游应用端对推理成本极致敏感性的倒逼,单纯依赖硬件堆砌的粗放型商业模式正在遭遇边际报酬递减的强力制约 。
英伟达黄仁勋在GTC 2026大会提出的Token工厂概念,正从理论走向实践。软通动力“北京壹号词元工厂”已点亮并签署头部大模型智算服务协议,Token分润模式开始落地。DeepSeek V4正式版7月中旬上线,首次引入峰谷定价机制,高峰时段API价格翻倍。算力租赁市场规模2026年预计突破2600亿元,行业正从“认证为王”走向“货源为王”。
第一章——算力租赁的商业革命
Token工厂由英伟达CEO黄仁勋在GTC 2026大会提出,是以大规模GPU算力集群为底座,整合电力、液冷、高速网络与大模型推理优化技术,工业化、标准化量产AI Token的新型算力基础设施。词元是大模型处理文本、图像、语音的最小语义单位,是AI时代的“智能基础货币”,可计量、定价、交易。
Token工厂的本质:从卖“算力/卡时”转向卖“智能单元Token”。 传统算力租赁的核心定位是“算力资源仓库”(卖卡时/机柜),盈利模式为按时长/空间计费,毛利率30%-40%,核心指标是GPU利用率和上架率。Token工厂的核心定位则是“智能工业化生产线”(卖Token),盈利模式为按量计费+生态分成,毛利率可达50%-70%,核心指标是Token吞吐量和单位Token成本。

理解Token工厂,需要先理解算力租赁行业正在经历的三次定价范式跃迁。
范式1.0:裸金属按月出租。这是最原始的模式。算力租赁公司买GPU、建机房,按卡时或月租形式出租给客户,收入=卡数×单价×上架率。毛利率20-30%,净利率10-15%。本质是"重资产包租婆"——赚的是资金成本和客户需求之间的利差。同质化竞争严重,定价权脆弱。传统IDC厂商是这个阶段的典型代表。
范式2.0:云服务按需计费。在裸金属基础上,算力租赁商开始提供容器化、虚拟化服务,按分钟/小时计费。这是目前国内主流模式。毛利率提升至30-40%,但核心盈利驱动变量依然是卡数和上架率。新IDC是这一阶段的成长型玩家。
范式3.0:Token工厂按产出分成。这是当前正在发生的质变。算力租赁公司不再按"租了多少卡"收费,而是按"产出了多少Token"收费。收入=保底租金+超额Token流水×分成比例。客户(大模型厂商)将底层算力运营外包给Token工厂,只关心"花了多少钱拿到了多少Token"——这相当于从"租厂房"升级为"买产品"。
Token工厂的本质是把算力资产从"线性折旧资产"改造为"可通过运营提周转的产线资产"。这不是简单的"换个收费方式"——它重新定义了算力租赁公司的价值捕获层级。

这套机制的巧妙之处在于风险-收益的非对称分配。保底租金保障了资产方的本金回收下限——即使Token调用量不及预期,设备成本和基础利润仍被覆盖。超额分成则打开了上行空间——当AI应用(Agent/多模态/Coding)带动Token消耗指数级增长时,Token工厂的利润增速远超传统算力租赁的线性增长。
具体测算:按GLM-5.1国内价格(输入6元/百万Token、输出24元/百万Token、缓存1.2元/百万Token,大模型厂按6.5折结算),单台8卡B300每天有效运行10小时、输出2万t/s、输入5-6万t/s、缓存40万t/s,单台月Token流水约88-93万元。若工厂拿80%分成,月收入约70-74万元/台——远高于传统月租金约25-35万元/台的水平。
第二章——DeepSeek革新机制
6月29日深夜,DeepSeek官方向API用户发送通知:V4正式版计划7月中旬上线,同步引入峰谷定价机制。高峰时段(工作日9:00-12:00、14:00-18:00)API价格翻倍;非高峰时段维持2026年5月22日调整后的永久优惠价。
这个定价机制的信号意义远超价格本身。
第一,Token正式成为可弹性定价的基础资源商品。峰谷定价的本质是"价格信号引导资源优化配置"——让批处理、离线分析等非实时任务主动错峰到低谷时段,把高峰算力留给实时客服、Agent工作流等对延迟敏感的场景。这和电力行业的峰谷电价如出一辙:Token正在变成AI时代的"千瓦时"。
第二,即便翻倍,DeepSeek仍是性价比之王。V4 Pro高峰输出价12元/百万Tokens,仅为豆包2.1 Pro(30元)的40%、GPT-4o(约72元)的17%、Claude Opus 4.8(约180元)的7%。这决定了DeepSeek峰谷定价对算力需求总量的压制作用非常有限——客户不会因为高峰翻倍就减少使用,最多是调整调用时间。
峰谷定价利好Token工厂模式。Token工厂的核心能力之一就是"算力调度"——通过模型切片、队列管理、智能调度等技术,在同样硬件基础上提升单位GPU的Token产出。峰谷定价相当于给了调度能力一个直接的经济激励:谁能更好地"削峰填谷",谁就能捕获更大的利润空间。
Token工厂模式对算力租赁行业最深远的影响,不在于"多赚了几个点的利润"——而在于彻底改变了市场对算力租赁公司的估值框架。
传统算力租赁公司的估值锚是"卡的残值"——市场看的是你有多少张GPU、这些GPU值多少钱、能产生多少租金收入。这本质上是一个重资产、低周转、线性增长的估值框架,类似于IDC或基础设施REITs的估值逻辑。所以传统算力租赁公司的PS估值普遍在2-4倍。
Token工厂的估值锚切换为"年化Token产值"——市场不再只看你有多少卡,而是看每张卡、每度电、每秒能产出多少高价值Token。这本质上是一个重资产、高周转、指数弹性的估值框架,类似于SaaS或平台型公司的估值逻辑。海外参照:CoreWeave(绑定英伟达+微软/Meta长协,未履行合同668亿美元)PS估值约15倍;Together AI/Fireworks AI等纯Token工厂型公司PS估值可达到20-30倍。

对行业整体:重大利好。Token工厂模式将算力租赁行业的TAM(总可寻址市场)从"GPU租赁市场"(2026年全球约88亿美元)扩展到了"AI推理服务市场"——后者的规模远大于前者。IDC预计到2030年全球年度Token消耗将从2025年的0.0005 Peta Tokens升至15.2万Peta Tokens。Token工厂本质上是在把产业链的蛋糕做大——传统算力租赁只能吃到"硬件出租"这一层,Token工厂可以吃到"模型推理服务"这一层。
对个体企业:高度分化。Token工厂模式不是所有算力租赁公司都能做的。它需要四个核心能力:①拿卡能力(高端GPU供给);②调度能力(模型切片/队列管理/缓存优化);③客户绑定(与大模型厂商的深度合作);④资本实力(重资产前期投入)。只有同时具备这四个能力的企业,才能从"算力二房东"升级为"Token工厂运营商"。不具备这些能力的公司,将在传统算力租赁的同质化竞争中继续内卷。
对资本开支:短期拉动、中长期优化。Token工厂模式在初期需要更大的资本开支(因为需要自建AI数据中心、采购大量GPU),但一旦投产,单位资本的Token产出效率远高于传统模式,回本周期缩短一半。这意味着短期Capex加速增长,但中长期资本回报率(ROIC)大幅改善——这是资本市场最喜欢的"投资前置、回报后置但高弹性"的模式。

全球算力租赁市场正处于从"范式2.0"到"范式3.0"的关键切换期。中国信通院数据显示,2026年Q1国内算力租赁市场规模达680亿元(+62% YoY),全年预计2600亿元。全球2026年预计突破800亿美元。2023-2028年中国智能算力规模CAGR达46.2%。
第三章——核心玩家深度对比
这六个指标覆盖了从领先到滞后的完整时序链。当前状态是:六个指标中五个处于积极区间(GPU租赁涨价、云产品涨价、Token消耗加速、采购放量、现金流改善),仅大模型自建算力趋势需要关注(DeepSeek 700亿融资计划可能分流部分租赁需求,但对Token工厂模式反而是利好——大模型厂更需要专业化的Token生产能力外包)。

我们对2026下半年算力租赁行业给出"强景气、强分化"的判断。
"强景气"的理由:①AI应用形态从Chatbot向Agent/Coding/多模态扩散,Token消耗进入结构性跃升——IDC预计2030年全球活跃AI Agent达22.16亿,年Token消耗从0.0005→15.2万Peta Tokens;②高端GPU供给仍然紧张——Blackwell系列现货租赁价涨48%,H100一年期租约涨40%;③云厂商集体涨价形成价格传导——腾讯/阿里/百度AI算力产品涨价5-34%;④DeepSeek峰谷定价不会抑制需求总量,只会优化时间分布。
"强分化"的理由:①Token工厂模式需要调度能力+客户绑定+资本实力的三重门槛,不是所有算力租赁公司都能转型;②传统裸金属租赁商面临毛利率持续压缩(同质化竞争+云厂商涨价只传导到有调度能力的公司);③大模型厂商自建算力趋势(DeepSeek 700亿融资)可能加速行业分化——绑定大厂的Token工厂受益,独立中小租赁商受损。
产业链价值分布呈现明显的"微笑曲线":上游GPU芯片(英伟达60-75%毛利率)和下游AI应用(40-70%毛利率)处于高位,中游传统算力租赁(20-35%)处于低位。Token工厂运营商(50-70%毛利率)是唯一在中游环节实现价值跃迁的模式——它通过调度优化和Token分成,把原本属于客户内部低效率环节的"损耗"转化为自己的利润池。
核心判断如下
判断一:Token工厂不是概念炒作,而是商业模式代际跃迁。从"按卡时收费"到"按Token产出分成",本质是从"卖资源"升级为"卖产品"。这一定价范式的改变,将重新定义算力租赁行业的盈利弹性和估值框架。
判断二:DeepSeek峰谷定价是Token"电价化"的里程碑。峰谷定价+Token工厂+云厂商涨价,三重共振将推动算力租赁行业从"成本中心"向"利润中心"转型。7月中旬V4正式版上线后的实际调用量和开发者反馈,将是验证这一判断的关键观察窗口。
判断三:行业将出现"强分化"——Token工厂估值溢价,传统租赁估值折价。具备调度能力+客户绑定+资本实力的Token工厂运营商,有望获得PS 10-20倍的SaaS级估值;传统裸金属租赁商将维持PS 2-4倍的基础设施估值。两者之间的估值裂口将持续扩大。
判断四:2026下半年是"验证窗口"——龙头利润兑现决定行情方向。重点关注龙头公司的中报业绩兑现情况,将决定市场对Token工厂模式的信心是加强还是动摇。
判断五:最大风险不在需求端,而在供给端。如果美国放松对华GPU出口管制,或国产GPU大规模量产,算力租赁的"稀缺性溢价"将消退,Token工厂的利润弹性也将随之收窄。反之,如果管制持续收紧,Token工厂的壁垒和价值将进一步凸显。