众力资讯网

本地大模型上下文只有8192?3060实测能开到384K 玩本地大模型常被上下文

本地大模型上下文只有8192?3060实测能开到384K
玩本地大模型常被上下文小、显存不够劝退。moe-l2项目有个更气人的bug:你明明在启动参数里写了要256K上下文,它启动完一看,实际只有8192。这并非引擎或模型问题,而是moe-l2封装层估算KV大小时高估了16倍,导致自动降档保护锁死了请求。


实测RTX 3060 12G跑Qwen3.6-35B-A3B模型:IQ2档(11.5GB)可稳定开256K上下文,显存占8.7G;Q4档(22.1GB)因权重大,显存预算被压缩,只能开128K。moe-l2 0.13.0已修复此bug,新增--ctx-force参数,信任你给的上下文大小,跳过自动降档。


要真正拿到256K,关键在验证:看llama-server启动日志里的n_ctx_slot,是262144就对了。上下文不是越大越好,开得越大显存占用越高、速度越慢,按需开即可。