众力资讯网

DeepSeek发布DSpark 今天DeepSeek发的东西,不是新模型,但可

DeepSeek发布DSpark 今天DeepSeek发的东西,不是新模型,但可能比新模型更重要。DSpark——一个让大模型跑更快而不是更聪明的方案。

大模型生成文本的方式其实特别笨:一个词一个词往后磨,每个词都要跑一遍完整计算。你等AI回复时那个卡顿感,就是这么来的。推测解码的思路是让小模型先批量写草稿,大模型一次性批改,听起来合理,但一直有两道墙挡着。

第一道墙,小模型写得快但容易串味(行话叫多模态碰撞)。比如上下文可以接of course也可以接no problem,并行起草可能拼出of problem这种缝合怪,后面几个词的接受率直接崩。

第二道墙,在线上高并发环境,把草稿全部送去批改本身就是浪费,那些大概率会被拒的尾部词在挤占GPU算力,本可以拿去服务别的用户。DSpark的解法,我觉得用各司其职四个字概括最好。并行骨干负责开头,一个极轻量的串行头负责尾巴。2层就压过5层纯并行方案,延迟只多0.2%。更关键的是它第一次把验多长这个问题当正经事来解决。给每个候选词打置信度分,闲时多验几个,忙时只验高置信部分,把算力留给更多用户。

有人说AI Infra又被DeepSeek加速了。我更想说的是,DeepSeek在解决一个更落地的问题,让算力真正花在该花的地方。