众力资讯网

4x3090 设备上为 Qwen3.8 27B 运行了完整的量化阶梯:从 FP8 到 2 bit 的 12 种格式,每种 720 个真实任务,没有令牌上限。 235 小时纯模型时间。跨 19,925 次调用生成了 30.9M 个令牌。 完整诚实的测试结果和原始追踪记录都在这个帖子中,阶梯底部的结果让我大吃一惊。 UD-Q4_K_XL 以 660/720 的成绩位居榜首。AWQ 658,NVFP4 657,AutoRound 657,普通 Q4_K_M 656。FP8 占用 30.9 GB,得分 647,落后于三种 4 位格式。 UD-Q2_K_XL 占用 9.8 GB,可在一张 3090 上运行,并且在代理套件上仍保持 0.86 的得分。大小仅为 vLLM 能服务的任何模型的一半,但答案相同。转 #ai模型训练 #本地部署ai #codex #qwen

4x3090 设备上为 Qwen3.8 27B 运行了完整的量化阶梯:从 FP8 到 2 bit 的 12 种格式,每种 720 个真实任务,没有令牌上限。
235 小时纯模型时间。跨 19,925 次调用生成了 30.9M 个令牌。
完整诚实的测试结果和原始追踪记录都在这个帖子中,阶梯底部的结果让我大吃一惊。

UD-Q4_K_XL 以 660/720 的成绩位居榜首。AWQ 658,NVFP4 657,AutoRound 657,普通 Q4_K_M 656。FP8 占用 30.9 GB,得分 647,落后于三种 4 位格式。
UD-Q2_K_XL 占用 9.8 GB,可在一张 3090 上运行,并且在代理套件上仍保持 0.86 的得分。大小仅为 vLLM 能服务的任何模型的一半,但答案相同。转
#ai模型训练 #本地部署ai #codex #qwen