今天中午 12 点,DeepSeek 正式发布了 V4.1 Flash 模型。这次更新信息量很大:三种模式合一、原生多模态、价格大幅下调,而且官方明确说它已经全面超越 V4 Pro——旗舰版 9 月 14 日就要被它取代下线。
我第一时间翻完了官方文档和技术报告,把这次更新里对普通开发者真正有用的信息整理出来。先说结论:如果你在用 DeepSeek API,这波值得认真对待。
一、三种模式合一,再也不用手动切换了
以前用 DeepSeek,你得在快速模式、专家模式、识图模式之间手动切换,选错了要么浪费钱要么效果差。现在三种模式合并成一个智能模式:模型自动判断你的问题有多复杂,检测到图片就自动开视觉能力,难题自动加大思考力度。
对写代码的人来说是实打实的省心——不用再纠结"这个问题该用哪个模型",一个 deepseek-flash 全搞定。
二、价格:输出 token 降到旗舰版的 30%
直接看官方定价页的对比(百万 tokens,空闲时段价格):
- 输入(缓存命中):V4.1 Flash 0.02 元 vs V4 Pro 0.15 元,降到 13%
- 输入(缓存未命中):V4.1 Flash 1 元 vs V4 Pro 4.5 元,降到 22%
- 输出:V4.1 Flash 4 元 vs V4 Pro 13.5 元,降到 30%
而且它采用峰谷定价:工作日高峰时段(9:00-12:00、14:00-18:00)价格翻倍,其余时间半价。也就是说,晚上和周末跑批量任务,成本还能再砍一半。
更关键的是架构层面的变化:新模型把 KV Cache 压到了上一代的 1/4,对 SSD 的需求降到 1/8。做 Agent 开发的都知道,长任务里缓存命中费用占比很高——这部分成本直接被砍掉了大半。
三、552B 参数的 MoE,输入激活只有 8B
技术层面这次也有真东西。V4.1 Flash 是 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder 结构:输入激活仅 8B,输出激活 16B,输入输出不对称设计让成本显著低于同尺寸模型。
上下文长度 1M,输出最大 384K,支持图像理解(V4 Pro 不支持)、Tool Calls、Responses API、Anthropic API,并发限制直接给到 2500(V4 Pro 是 500)。模型权重和技术报告已同步开放在 Hugging Face。
四、三件需要立刻行动的事
- 9 月 14 日 12:00 前:如果你在用 deepseek-v4-pro,请求会被全部路由到 V4.1 Flash 并按 Flash 计费。别等系统自动切,主动把模型名改成 deepseek-flash,顺便测一遍效果
- 旧模型名兼容:deepseek-v4-flash、deepseek-v4-flash-vision-exp 已下线,请求会路由到 V4.1 Flash,建议直接改用新模型名
- 批量任务挪到闲时:峰谷价差一倍,晚上和周末跑 Agent 任务、长文本处理能省不少
写在最后
"小尺寸模型全面超越旗舰"这种事,一年前还像天方夜谭,现在成了 DeepSeek 的常规操作。552B 参数、8B 激活、输出价格只有旗舰三成——这套组合拳打下来,大模型 API 的价格底线又被拉低了一截。
对开发者来说,现在的问题是:省下来的预算,是继续堆量,还是试试以前舍不得跑的长任务?欢迎评论区聊聊你的用法。
评论区