手机上也能跑DeepSeek V4 Flash 0731?
开源社区上有个项目:BigMoeOnEdge,据称功能包括:运行比 RAM 容量更大的 MoE 模型。例如,在 12GB 内存的手机上运行 284B 模型,仅使用 CPU,无损压缩,基于原生 llama.cpp 库。
它目前能做的最极端的事情:DeepSeek V4 Flash 0731,一个284B参数的MoE(在2位专家量化下占用约91GB磁盘空间),在一台配备12GB内存的手机上以大约 1 tok/s的速度生成。模型大小是内存的七倍多,以Hugging Face发布的三份分片文件的形式从闪存中流式传输,没有合并步骤,循环中也没有程序控制器(PC)。
操作也很简单,在手机上安装最新版本的apk,打开“获取型号”卡片,可以选择Qwen3-30B-A3B(约 18.6 GB)、Qwen3.6-35B-A3B(约 22.3 GB)或 Gemma-4-26B-A4B(约 17 GB),每个型号的内存都超过大多数手机的运行内存的模型。


