忘记 vLLM、llama.cpp 和昂贵的 GPU 吧。
[colibri]
这可以在仅用纯 C 和从磁盘流式传输专家的情况下,用大约 25 GB RAM 运行 GLM-5.2(744B MoE)。
你不是想要它,你需要它!
REPOOO👇网页链接

忘记 vLLM、llama.cpp 和昂贵的 GPU 吧。
[colibri]
这可以在仅用纯 C 和从磁盘流式传输专家的情况下,用大约 25 GB RAM 运行 GLM-5.2(744B MoE)。
你不是想要它,你需要它!
REPOOO👇网页链接
