众力资讯网

看到满屏都在聊DeepSeek V4的百万token,我就问一句:你们谁真的在本地把它跑起来过? 我见过太多人把“支持1M上下文”当成一句口号转发,但很少有人愿意聊另一个更实在的数字:要让V4在你自己机房里真正转起来,到底需要几张卡、多少电、几台服务器。 2026年4月24日,V4-Pro和V4

看到满屏都在聊DeepSeek V4的百万token,我就问一句:你们谁真的在本地把它跑起来过?

我见过太多人把“支持1M上下文”当成一句口号转发,但很少有人愿意聊另一个更实在的数字:要让V4在你自己机房里真正转起来,到底需要几张卡、多少电、几台服务器。

2026年4月24日,V4-Pro和V4-Flash正式发布并开源,上下文从128K一下拉到1M,官方提到首次加入KV Cache滑窗和压缩算法,把Attention的计算和访存开销压了下来。但参数归参数,落到部署层面才是见真章的地方。

华为昇腾950超节点给出的实测数据是:V4-Pro在8K输入场景下TPOT约20毫秒,单卡Decode吞吐4700TPS;V4-Flash在同一场景下TPOT压到约10毫秒,吞吐1600TPS。注意后面括号里那行小字——这些数字基于离线推理模式采集,不含调度和负载均衡的影响。换句话说,线上真实环境里你能拿到的有效吞吐,会再打一层折扣。

这个折扣有多大,取决于你想拿来干什么。

如果你只是偶尔丢份合同进去让它找前后矛盾,网页版点一下就行,根本不用碰私有化。但如果你是一家政企单位的IT负责人,数据不让出内网,模型必须落在自己机房里,那问题就完全不一样了。

每日互动做了一件事很实在:针对V4-Flash做工程优化后,把它完整塞进了一台华为Atlas 800八卡服务器。而在此之前,同类国产大模型私有化部署通常需要四台服务器组成集群,硬件成本动辄五百万,且受集群间通信带宽限制,综合性能只能跑到理想状态的两成左右。从四台变一台,从五百万降到百万级,这个变化对预算有限但数据安全要求高的单位来说,比多几万token上下文要紧得多。

但硬件门槛降低,不代表你用起来就轻松了。有一份实测文档记录了一个真实压力测试:把83万字的技术白皮书灌进去,要求模型交叉比对第12章和附录D,输出三条建议并标注每条建议在原文中的依据位置。测试者特别指出,这种事不是“摘要”,而是逻辑锚定;不是“调用API”,而是让模型真正“读完、记住、关联、推理、定位、复述”。

这里暴露了一个容易被忽略的断层:文档解析成文本再注入模型之后,关键证据落在原文90%位置时,模型到底是在检索还是在理解?测试者的原话是“这个边界必须亲手划出来”。

所以我的判断是:V4的百万token确实把长文本处理推到了一个新位置,但它真正的分水岭不在“能不能读”,而在“读完能不能把散落在不同位置的逻辑缝回去”。

另外提一个容易被忽略的参数。DeepSeek官方推荐temperature=1.0、top_p=1.0,并特别提醒不要直接套用GPT-5.5或Claude的默认值。这意味着如果你从其他模型迁移过来,第一件事不是调提示词,而是先看一眼参数配置有没有沿用了别家的习惯。

部署门槛降了,上下文拉长了,但“能读进去”和“能读明白”之间,隔着的不是一张卡的距离,而是一整套从硬件调度到推理路径控制的工作量。百万token是入场券,不是终点线。