AMD的官博:与 Moonshot AI 一起,从第一性原理为 AMD GPU 重建智能体 AI 服务栈网页链接一篇讨论如何优化面向 Agent的推理服务的文章。
AMD 和Kimi 围绕 Kimi K2.6、SGLang、ROCm、MoRI 和自研 UMBP 构建了一套面向智能体工作负载的端到端服务方案。UMBP 把 GPU HBM、主机 DRAM、共享内存池和 SSD 组织成可调度的多层 KV 缓存,并让调度器不仅知道“哪里有前缀缓存”,还知道“从哪里取最快”。文章还介绍了多项优化:缓存回载预取、零 CU 的 SDMA 恢复路径、Prefill/Decode 间增量 KV 传输、DeltaTok 增量分词,以及工具调用与 GPU 推理重叠。How I AI
