Cohere 开源了 2.4B 参数的视觉语言模型 North Micro Vision,Apache 2.0 协议,权重直接挂到 Hugging Face,本地拉下来就能跑。以前那种动辄几十 B、显存一卡塞不下的 VLM,在文档解析这件事上,你可能不用再硬扛了。
这个模型明显是冲着"复杂文档"去的,官方把原生分辨率视觉处理、多轮图文对话、空间推理和视觉定位、多语种图像理解摆在最前面。对工程师来说,这意味着扫描件、表格、PDF 截图、发票、跨语种说明书这一类"图像里的文字",它想吃下来。
尺寸小不只是省显存,而是整个节奏的改变:同样的机器,可以跑更大 batch、开更高分辨率、做更密的 prompt 调参,迭代速度直接翻倍。官方称它在文档理解和视觉问答上尤其强,在多个视觉理解基准上压过了 Gemma 4 E2B 和 Ministral 3 3B。
不过,2.4B 体量面对需要世界知识和长链条推理的问题还是有上限,得看场景是不是"轻量本地 + 文档密集"。给内部文档、知识库、合同扫描件搭本地 VLM,值得先跑一跑 baseline;偏通用视觉问答,够不够用还得再掂量。
我的判断是,文档解析这条窄路上,North Micro Vision 把门槛拉低了一截,值得当成轻量首选之一;通用场景里还不足以直接替换更大的 VLM。
你现在跑文档解析用的是哪个模型,会考虑换 North Micro Vision 试试吗?


