一个开源框架,把大模型跑在 GPU、CPU 和磁盘三层上——热门专家放显卡、冷门专家放内存、三层缓存保证速度。
它叫 KTransformers。
kvcache.ai 出品的异构推理和微调框架。让你在消费级硬件上跑 DeepSeek-R1、GLM-5.2、MiniMax-M3,不需要 8 块 H100。
它不只是负载均衡:
→ GPU-CPU-磁盘 三层架构——热门 MoE 专家在 GPU,冷门专家在 CPU,前缀缓存在磁盘
→ AMX/AVX512/AVX2 优化内核——CPU 端 INT4/INT8 量化推理达到生产级速度
→ Day-0 模型支持——DeepSeek、GLM、MiniMax、Kimi、Qwen 发布当天就能跑
→ MoE 专家调度——NUMA 感知,智能放置专家到最快的位置
→ 集成 SGLang 推理框架 + LLaMA-Factory 微调
而且它是 Apache 2.0 开源免费的。
如果你看着 DeepSeek-R1 或 GLM-5.2 的基准测试,以为自己需要一机柜显卡才能跑……
KTransformers 让你把模型拆开,分散到 GPU、CPU、甚至磁盘上——还能达到生产级吞吐。
[收藏] 👇
大模型异构计算MoE开源推理
