当Token开始像度电一样计价,AI行业要重新算效率账了
中科曙光最近发布ParaCache,我一开始觉得只是个偏技术的推理优化方案。看完黄仁勋这次的说法,反而觉得这件事值得重新理解。
黄仁勋把AI数据中心称作生产Token的“工厂”。一旦Token真的逐渐成为AI产业的产出单位,评价算力的方式就会发生变化:不是机器买了多少,而是一块钱、一度电最终能够生产多少有效Token。
ParaCache做的恰恰是这件事——把已经计算过的内容保存下来,跨请求、跨节点复用,减少大模型重复干活。公开测试中,约12万Token输入下首Token等待时间最高降低98.5%,高并发吞吐最高提升27倍。
以前大家靠堆硬件提高产量;当硬件越来越贵,下一步很可能就是压榨每一份已有算力的效率。
从这个角度说,AI基础设施已经开始从“拼规模”进入“算经济账”的阶段。
中科曙光 ParaCache Token经济 大模型 AI推理
