众力资讯网

DeepSeek免费两周:旧模型刚退役,我连夜把配置改了

先说两件跟你钱包和时间都有关的事。 第一,DeepSeek 的新旗舰 V4.1-Flash,在它的官方合作平台上已经开

先说两件跟你钱包和时间都有关的事。
第一,DeepSeek 的新旗舰 V4.1-Flash,在它的官方合作平台上已经开放两周免费试用——注册就能跑,不用先绑卡。第二,V4-Flash 和 V4-Flash-Vision-Exp 这两个旧版本已经正式退役;V4-Pro 从 9 月 14 日中午 12 点起,所有请求自动切到 V4.1-Flash,并按 Flash 的价格计费。
翻译一下:旧型号不再维护了,你的调用被悄悄换了个模型,价格还降了。这本来是好事,但有个前提——你得先知道自己现在用的是哪个型号、什么时候必须动手改。
我把官方公告、Hugging Face 的模型卡和几家第三方测评翻了一遍,把真正有用的挑出来说。
一个552B的大块头,只肯出8B的力V4.1-Flash 是个 552B 参数的混合专家模型(MoE),但用了新的 Causal Encoder-Decoder 结构,读写不对称:处理输入时只激活 8B 参数,输出时激活 16B。
为什么要这么设计?因为真实场景本来就是读得多、写得少。你跟 AI 聊十轮,它读进去的是十轮对话加上万字的资料,真正吐出来的可能就几百字。便宜的活交给小算力,贵的活留给大算力,账就省下来了。
更狠的一刀在缓存上。每 token 的 KV Cache 占用,相比上一代只需要四分之一的显存(HBM)、八分之一的硬盘存储。对跑智能体的人来说,缓存命中费往往占成本大头,缓存瘦身等于直接省钱。上下文窗口也从 4K 拉到了 100 万 token,单次最多能吐 38.4 万 token。
跑分:干活能力提升最明显
跑分口径是 V4.1-Flash 对比上一代 V4-Flash-0731 和 V4-Pro,数据取自 Hugging Face 官方模型卡:
测试项
V4.1-Flash
V4-Flash-0731
V4-Pro
Terminal Bench 2.1(终端操作)
90.6
82.7
87.9
DeepSWE v1.1(改代码提PR)
74.2
54.4
62.7
Automation-Bench(跨软件流程)
54.8
37.7
43.2

三项全部第一,而且不是小胜:改代码那项从 62.7 涨到 74.2,跨软件自动化从 43.2 涨到 54.8。这几项考的都是让 AI 真正动手干活的能力,不是刷题库。
还有个变化容易被忽略:这是 DeepSeek 第一个原生支持图片输入的正式版模型。以前想让模型看图,得单独接一个视觉模型;现在一个模型全包了。官方给出的提升是响应速度比上代快 22%、多模态识别准确率提升 17%——不过这是官方口径,第三方独立复测还没出来。
这个能力落到办公室里是什么样?举三个我自己在用的场景:一是报表截图丢进去,直接问它这个月哪几项超标了;二是合同拍照上传,让它挑出跟模板不一致的条款;三是开会拍的白板照片,让它整理成会议纪要。以前这三件事要分开找工具、还要手动打字描述图片内容,现在一步到位。在多模态测试里,它读图表的成绩是 78.9 分,上一代的视觉版本是 64.3 分——提升是实打实的。
价格:错峰能省一半计费项(元/百万token)
闲时价
高峰价
输入(缓存命中)
0.02
0.04
输入(缓存未命中)
1.0
2.0
输出
4.0
8.0

高峰时段是工作日 9 点到 12 点、14 点到 18 点,其余时间(含晚上和周末全天)都算闲时。这个设计基本是在明着引导你错峰:上班时间大家挤在一起,价格翻倍;晚上和周末算力闲着,打对折。
拿我天天干的活算笔账:写一篇 1800 字的长文,全流程大约 50 万 token 输入、6000 字输出。就算输入全按未命中算,也就五毛出头,高峰时段翻倍也才一块钱。对比一下:混元 Hy4 输出 18 元、GLM-5.3-Flash 是 2.8 元——同一件事,价差能到几十倍。
三类人,现在分别该做什么
你是
现在要做的
时间点
普通用户
直接白嫖两周,能传图、能长文
现在
办公党
调 API 就错峰(晚18点后、周末全天)
随时
程序员
模型名改成 deepseek-flash,别再拖
10月24日前

几个容易踩的坑,我按时间顺序排一遍:
第一,V4-Flash 和 V4-Flash-Vision-Exp 已经退役,但旧模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 会临时路由到 V4.1-Flash,短期不影响使用,长期一定会断。
第二,9 月 14 日中午 12 点之后,deepseek-v4-pro 的所有请求已经自动切到 V4.1-Flash 并按 Flash 价格计费。你不用手动改,但要记得去账单上确认一下价格确实降了——按官方说法,大约是原来 V4 Pro 成本的四分之一。
第三,10 月 24 日是旧 API 的弃用时间点。靠老接口跑业务的,这周就把配置改过来,别等到最后一天。
再说个容易被忽略的点:如果你之前一直在用 V4-Pro,那么 9 月 14 日之后你的模型其实是被换过的,不是你自己选的。换模型意味着输出风格、回答长度、甚至某些任务上的表现都会变。做过提示词调优的团队,建议拿同一批测试用例跑一遍回归——尤其是要对外交付的内容,别等客户发现问题才回头查。
再补一句给想自己部署的人:它是开源的,MIT 许可,权重和技术报告都已经放在 Hugging Face 上,商用不用谈授权。但这次官方有两个信息没给——一是没有公布自托管 552B checkpoint 的硬件要求,二是没给每秒输出多少 token 的实测数据。对一个主打效率的模型来说,这个遗漏挺反常。想本地跑的,建议先等社区的部署实测出来再动手,别急着采购硬件。
冷水也得泼一盆第一,Automation-Bench 拿了 54.8 分看着不错,但换个说法就是:复杂的跨软件工作流,它仍然有一半会失败。真拿它跑无人值守的业务流程,人还得在环里盯着。
第二,它不是全能选手。在 Humanity's Last Exam 这类硬核知识测试上,它是 36.8 分,Claude Opus 5.0 是 56.3 分,差了将近 20 分。做研究助手、要回答硬核事实问题的场景,它不是最优选。
第三,那些漂亮的提升数字目前都来自官方。上一轮某些厂商临时改跑分的教训还在,官方分要打个折看。建议先白嫖这两周,用自己的真实任务跑一遍,再决定要不要把生产任务迁过去。
所以我给普通人的建议还是混合打法:日常批量处理、长上下文、跑智能体这类费 token 的活,交给 V4.1-Flash;真要啃硬核推理、要拿去对外交付的东西,再上更强的闭源模型。便宜的走量,贵的保底——就像上一代人的内网加外网。
说到底,这次真正变化的不是模型有多聪明,而是聪明模型正在变成白菜价:552B 参数、100 万上下文、原生能看图,还免费两周——三年前这是想都不敢想的配置。而对我们这些用 AI 干活的人来说,最实在的动作只有一个:趁免费这两周把它试明白,然后把该改的配置改掉。
你现在主力用哪个模型?这次切换有没有影响到你的账单?评论区聊聊,我按你们的情况出一版迁移清单。这份价格表和三个时间点建议先收藏,10 月 24 日之前翻出来核对一遍配置。
(数据来源:DeepSeek 官方 V4.1-Flash 发布公告、Hugging Face 官方模型卡、Baseten 技术博客、DataNorth 报道。价格与切换时间以官方公告为准,跑分为官方模型卡口径。)