🧠 非对称架构,更多智能,更低成本
🔹 552B参数 MoE
🔹 全新因果编码器-解码器架构:输入仅 80 亿活跃参数,输出 160 亿
🔹 全新预训练方法 + 更大规模 RL 后训练,基准测试结果领先旗舰模型,包括 DeepSeek-V4-Pro
💾 更小的 KV 缓存,更大的节省
与上一代相比,V4.1-Flash 的 KV 缓存仅需:
🔹 1/4 的 HBM
🔹 1/8 的 SSD 存储 缓存命中费用往往占代理成本的很大一部分。压缩缓存会显著降低这些成本
技术报告放在附件啦~
#CMV #deepseek #deepseek4



