众力资讯网

DeepSeek代码库里冒出个"MODEL1",梁文锋这次藏不住了

搞AI的人最近都有个通病,叫"发布会疲劳症"。今天这家刷榜,明天那家发小作文,参数越堆越大,分数越刷越高,但打开自己手里
搞AI的人最近都有个通病,叫"发布会疲劳症"。今天这家刷榜,明天那家发小作文,参数越堆越大,分数越刷越高,但打开自己手里的Agent工具,该死循环还是死循环,该报错还是报错。
数字很漂亮,落地很骨感。这是现状。
所以当我前几天在GitHub上闲逛,点进DeepSeek的FlashMLA仓库,看到一个新的Commit里静静躺着一个从没见过的标识符的时候,我盯着屏幕愣了大概三秒钟。
MODEL1。
跟V32并排放着,有自己独立的参数配置,有自己的优化路径。这东西跟V3系列的迭代完全不是一个味道,这是另起炉灶。

熟悉DeepSeek节奏的人都知道,去年R1发布之前也是这个套路,代码先行,论文跟上,然后某一天突然丢出来一个东西,把所有人都炸醒。现在这个剧本,又开始了。
先说V3.2做到了什么。
Agent这个东西之前最大的问题,说白了就是"脑子想的和手干的不是一回事"。模型先想好一套步骤,然后去调工具,工具一报错,整个链条直接断掉,模型在那傻站着不知道下一步该干嘛。
V3.2把思考和工具调用揉到了一起。模型可以一边想一边干,工具报错了它能自己绕路,不至于整个人僵在原地。背后是DSA稀疏注意力机制,加上几万条复杂指令做的Agent强化学习。实测下来编程确实猛,一次写上千行代码不带犹豫的,ICPC测试里干到了人类选手第二名的位置。

但V3.2有两个绕不过去的坎。
一个是知识的保鲜问题。模型对固定知识的记忆全靠训练数据,API参数变了、代码库更新了,它不知道,就开始编,这就是幻觉的根源。另一个是长上下文的成本,DSA已经在优化了,但离真正好用还有距离。
然后你再看DeepSeek最近发的两篇论文,事情就对上了。
第一篇,和北大合作搞的"条件记忆"模块,叫Engram。核心思路很直接——把高频的静态知识从神经网络的计算里摘出来,单独存成一个嵌入表,模型推理的时候不用重新算,直接查表调用。
翻译成人话就是,模型以后记API参数、记代码片段这些事,不再靠"回忆",而是靠"查字典"。该准的地方准,该快的地方快,幻觉的根子直接被刨了。

第二篇,流形约束超连接框架,叫mHC。解决的是训练稳定性。模型越大,训练过程越容易崩,mHC从数学层面给训练过程上了一道硬约束,让大规模训练不再像走钢丝。
这两个东西放到一起看,指向性太明确了。一个管推理端的知识准确和效率,一个管训练端的规模和稳定。这不是修修补补,这是在给下一代模型铺地基。
再加上The Information放出的消息,说DeepSeek V4内部测试在编码任务上可能超过Claude和GPT系列,计划二月中旬发布。
编码这个赛道为什么重要,因为它同时考验逻辑推理、工具调用和知识准确性,是目前对大模型综合能力要求最高的场景。V3.2解决了工具调用的断档问题,Engram解决了知识幻觉问题,mHC保证了更大规模的训练不翻车。三件事拼到一起,如果真做成了,那编码这个领域的格局要变。

整个AI行业前两年拼的是谁分数高、谁参数多,但到了现在这个阶段,真正拉开差距的已经不是这些了。谁能让模型在实际干活的时候不掉链子,谁能让Agent真正像个靠谱的协作者而不是一个需要人盯着的实习生,这才是硬仗。
DeepSeek这个团队有意思的地方在于,他们好像一直不太在乎台面上的热闹,闷头在底层架构上啃硬骨头。R1是这样,V3.2是这样,现在MODEL1又是这样。
春节前后这段时间,可能比大家想的要热闹。
你们现在手里用的AI工具,最让你受不了的是哪个毛病?