这两天 AI 推理圈连放三炮,方向一致:不比谁更聪明,比谁更省。五件事,三分钟看完。
01|DeepSeek V4.1-Flash:KV Cache 缩到 890 字节
9 月 10 日,DeepSeek 发布 V4.1-Flash,全局 KV Cache 压到每 token 仅 890 字节——上一代 V4-Flash 的四分之一,最早的 V1 的约四百三十七分之一。
靠三招:缓存改用 FP4 精度存;40 层拆成 20 层编码器加 20 层解码器,输入侧只激活 8B、输出侧 16B,一个 552B 的模型干活的只有十几 B;注意力层分"全算 / 复用索引重打分 / 连索引都复用"三种模式。
看点:长上下文的死穴从来不是算力,是显存。这是第一次把"每 token 缓存成本"拉到 1KB 内,还配了 100 万 token 上下文。缓存命中输入价同步降到 0.02 元/百万 token。
02|SGLang 和 Miles 当天适配:把 189GB 专家表搬出显存
V4.1 里两张 fp8 大表合计 189GB,每个解码步都要查,但每 token 真正读到的只有几 KB。SGLang 把整张表放进主机内存、显卡只管计算,4 张 GB300 上实测 KV Cache 容量多出 36%,吞吐与首 token 延迟没掉,28 条试探输出与基线逐字一致。另有"滑动窗口有界重放":只留最近 128 个位置,命中时只重算 128 个 token。
同批人还开源了全栈后训练框架 Miles(Apache-2.0),演示是 744B 的 GLM-5.2 做全异步 Agent 强化学习——真跑终端编程活,64 张 GB300,中位单步 263 秒。看点:异步 Agent RL 最难,rollout 要几分钟、回来顺序还乱,训练得在半数机器仍在生成时继续学。
03|英伟达开源 SoL-Pi:给 Agent 框架做"省电模式"
9 月 11 日,英伟达开源自家 Harness SoL-Pi,让 AI 自己搜"哪里在白白烧 Token",从 152 个候选方向筛出四套机制。相比底座 Pi,Token 少用 45%–49%、成本低约三分之一、得分保留 94%。
看点:这是"递归自我改进"第一次被做成省钱生意——以前 AI 每改进自己一次都要花 Token,失败方案照样收费。
04|Hugging Face TRL v1.13:后训练开始啃百万上下文
9 月 10 日,TRL 发布 v1.13,重点是长上下文后训练,新增 100 万 token 以上模型的后训练指南。
看点:推理侧早就跨过百万 token,公开的 RL 后训练负载却普遍卡在 256K 以下,因为全序列 GRPO 的显存顶不住。主流训练库正面处理,说明这条链在补齐。
05|没有 NVLink 也快 12%:视频生成推理压到 28.7 秒
9 月 11 日,RunningHub 开源 H3 Lightning。在 8 张 RTX 6000D、PCIe 无 NVLink 的环境下,TP2+Ulysses4 比 TP4+Ulysses2 快约 12%、少占约 14GiB 显存;后训练加速模型压计算量,SageAttention2、Cache-DiT、torch.compile 提效率,生成从 43 秒压到 28.7 秒,最后整合进 SGLang multimodal_gen。
看点:堆顶级 GPU 跑快不稀奇,问题是手里的机器能不能跑出这个速度。
同日另有三条快讯:高通新一代 Hexagon NPU(共享内存 +50%)、AMD 锐龙 AI Max PRO 400 与 Instella-MoE 全开源(首 token 延迟最高降 39.2%)、海光"词元经营双芯"。
主线很清楚:前两年比"单个请求跑多快",现在比"每 token 花多少钱"——KV Cache 从 FP16 到 FP4,专家表从显存到主存,连 AI 改进自己都要省。你觉得哪一项最先落到你的工作流上?
ai代部署
