众力资讯网

A7888,苹果前天发了两颗新桌面芯片,M6 和 M5 Ultra。然后我做了一

A7888,苹果前天发了两颗新桌面芯片,M6 和 M5 Ultra。然后我做了一件很闲的事,拿它们去对照上个月开源的 Kimi K3,就是那个 2.8 万亿参数的模型,看看到底什么机器能本地跑满血。

📮先说 M6 的新 Mac mini。苹果首款 2 纳米芯片,12 核 CPU 加 12 核 GPU,GPU 每个核心里都塞了神经加速器,AI 性能比 M4 版最高 4 倍。国行 6999 起,比上代涨了一千,16G 起步,最高只能选 32G 内存。定位很明确,日常干活加中小模型,属于桌面上的 AI 小家电。

📮再说 M5 Ultra 的 Mac Studio。苹果史上最强芯片,两颗 M5 Max 搓成四晶粒,36 核 CPU、80 核 GPU,512G 统一内存,带宽 1.2TB/s。512G 是个什么概念呢,DeepSeek R1 满血 671B,4-bit 量化 404GB,单台直接装下,上一代工作站要摆一排显卡的活,现在桌子底下一台就干。

📮但这台怪兽到了 Kimi K3 面前也只是个弟弟。K3 的官方权重是 MXFP4 格式,1.56TB。注意它不是普通 4-bit,是量化感知训练出来的,这就是满血,没有更满的版本,也没有免费压缩的空间。想本地跑,单台 512G 差着整整一 TB 的内存。

📮那怎么办。最实惠的是大内存服务器做 CPU 卸载,4 万到 40 万不等,但速度只有每秒 10 个 token 左右。要不就 4 台 M5 Ultra 组集群,2TB 共享内存,40 万人民币起,速度估计每秒 15 个 token。最难受的是,K3 现在是英伟达和 AMD 的显卡 Day0 支持,苹果生态的移植还没影,你买完机器可能得先干等着。

然后我看了一眼 K3 的 API 价格。输出一百万 token,一百块人民币。我用本地部署那 40 万,能烧到 40 亿个 token。

算完这笔账我把购物车里的 Mac Studio 删了,只留了个 Mac mini。孙老师问我为啥不一步到位,我说这步有点大,容易劈着胯。