官宣下线 9 月 14 日到期:DeepSeek V4 Pro 的旗舰生涯为何只有 31 天?
【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813
2026 年 9 月,大模型圈出现了一则略显荒诞的消息:DeepSeek 在同一天官宣了两件事——新一代DeepSeek V4.1 Flash 正式发布,同时V4 Pro 的 API 服务"推迟到 9 月 14 日下线"。这意味着,8 月中旬刚以"正式版(0813)"身份深夜突袭上线、被多家媒体评价为"逼近 Fable 5"的旗舰模型,满打满算只有一个月的服务窗口期,就完成了从"旗舰"到"退役"的交接。
对正在调用 V4 Pro 接口的开发者来说,这不仅是新闻,更是一份必须倒计时执行的迁移通知;而对关注开源生态的人而言,官方仓库里那份名为DeepSeek-V4-Pro-0813的完整权重与推理代码,恰好是解读这次"短命旗舰"策略的最佳注脚。本文结合公开报道与仓库源码,拆解这 31 天里究竟发生了什么。
同天官宣:V4.1 Flash 发布与 V4 Pro 下线的组合拳
据公开报道,DeepSeek 在 9 月官宣V4.1 Flash 模型发布,并同时披露V4 Pro 服务将推迟至 9 月 14 日下线。这两条消息放在一起看,才构成完整的产品策略:Flash 系列不再只是"Pro 的轻量廉价版",而是以"全面超越 V4 Pro"的姿态直接接过了旗舰大旗。
回看 V4 Pro 正式版的上线,时间线相当紧凑。8 月中旬,DeepSeek 以"深夜突袭"的方式发布正式版(版本号 0813),多家媒体报道其多项智能体评测成绩逼近 Anthropic Fable 5,同时第一财经披露其 API 价格是 Flash 版的三倍。也就是说,一款定价三倍于 Flash 的旗舰模型,只获得了约一个月的服务窗口。这里的"31 天"并非夸张——按公开报道推算,8 月 14 日正式版官宣上线,到 9 月 14 日服务到期,恰好一个月。
这种"发布即倒计时"的节奏,在传统软件行业几乎不可想象,但在 MaaS(模型即服务)时代正成为一种新常态:模型版本的生命周期由推理引擎的迭代速度和产品线的定位冲突共同决定。
这 31 天里发生了什么:从预览到正式,再到退场
V4 Pro 的"旗舰生涯"其实比 31 天更长,只是正式版窗口很短。仓库 README.md 开篇就写明了版本沿革:
DeepSeek-V4-Pro-0813is the official release ofDeepSeek-V4-Pro, superseding the preview version, with greatly enhanced agentic capabilities...
也就是说,0813正式版是对预览版(Preview)的全面接替,核心增量在于智能体(agentic)能力。这一点在仓库的官方基准表中体现得淋漓尽致:
| Benchmark | V4-Pro-0813 | V4-Pro (Preview) | V4-Flash (Preview) | Fable-5 (w/ fallback) |
|---|---|---|---|---|
| DeepSWE | 62.7 | 12.8 | 7.3 | 70.0 |
| NL2Repo | 61.5 | 38.5 | 39.4 | - |
| Cybergym | 83.3 | 52.7 | 38.7 | 83.1 |
| Terminal Bench 2.1 | 87.9 | 72.1 | 61.8 | 88.0 |
| AutomationBench (Public) | 31.8 | 12.8 | 10.8 | 29.1 |
其中 DeepSWE 从预览版的 12.8 跃升至 62.7,涨幅接近五倍——这正是后训练阶段针对长链路代码执行与工具调用做定向优化的结果。README 还注明这些智能体任务使用 DeepSeek Harness 的 minimal 模式作为 agent 框架评测,与财联社报道的"V4 全系列上线后 DeepSeek Harness 开发者预览版开放测试"相互印证。
支撑这些成绩的是仓库 config.json 里写死的硬核架构参数:384 个路由专家(每 token 激活 6 个)的稀疏 MoE、61 层 Transformer、1048576 的 max_position_embeddings(百万 token 上下文)、fp4 专家权重 + fp8 激活量化。而正式版相比预览版的另一个技术增量,是挂在模型结构上的DSpark 投机解码模块——model.py 中的DSparkBlock、DSparkMarkovHead、DSparkConfidenceHead通过马尔可夫链草稿模型 + 置信度头,实现单次前向多 token 预测,README.md 给出了 vLLM 与 SGLang 下一键开启的方式:
vllm serve deepseek-ai/DeepSeek-V4-Pro-0813 \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'那么,一款刚把智能体能力打磨到顶级、还带了全新投机解码的旗舰,为什么只给一个月的服务期?从公开信息能读出三层信号。
31 天生命周期背后的版本策略解读
第一层:推理引擎的迭代节奏快过了模型本身的"保质期"。关注 DeepSeek 版本史会发现,它的模型标识符更新早已常态化:2026 年 7 月 24 日,旧标识符deepseek-chat与deepseek-reasoner正式退役;8 月中旬 V4 Pro 正式版接棒;9 月 14 日 V4 Pro 又让位于 V4.1 Flash。仓库目录名DeepSeek-V4-Pro-0813本身就是版本节拍器的证据——以发布日期作为版本后缀,意味着每一次权重发布都自带"新鲜度时间戳"。当 V4.1 Flash 在智能体与通用能力上"全面超越 V4 Pro"时,继续维护一条定价三倍、性能却不再领先的产品线,对算力调度和 API 运维都是净负担。
第二层:用 Flash 承接流量,是成本结构的必然选择。第一财经报道 V4 Pro 价格是 Flash 版三倍,而 Flash 系列本就为高吞吐、低延迟场景设计。仓库源码同样暗示了这一点:V4 系列在注意力层做了大量"省显存"设计——model.py 中的Compressor实现学习式门控池化的 KV 压缩,Indexer用可学习评分头挑选 top-k 压缩位置做稀疏注意力,配合滑动窗口(sliding window)与 YaRN 外推,把百万 token 上下文的显存与算力成本压到可商用水平。这类架构决定了"廉价高吞吐"的 Flash 才是流量主力,Pro 更多承担"能力标杆"的定位——标杆既已完成历史使命,退场就是时间问题。
第三层:短周期旗舰正在成为国产模型竞争的新常态。头条社区流传的测评显示,V4 Pro 正式版综合得分仍落后于 Kimi K3、接近 Grok 4.6,说明"旗舰"的定义更多是"某一时刻的最强能力展示",而非长期服役的常青树。麻省理工科技评论报道的"DeepSeek V4 适配昇腾"则进一步暗示:国产模型正加速走向多硬件平台,版本更新越快,越能快速适配新生态。在这种语境下,一个月的旗舰窗口不是事故,而是精心设计的迭代策略——用频繁的版本更替制造技术势能,用 Flash 走量、Pro 立威。
对正在调用 V4 Pro 接口的开发者意味着什么
对 API 用户而言,9 月 14 日是硬性截止日期,迁移不是可选项。结合社区反馈与官方接口实践,有几件事需要立刻确认:
1. 迁移窗口与模型标识符。旧标识符(如deepseek-chat/deepseek-reasoner)已于 7 月 24 日退役,而 V4 Pro 的 API 模型名也有严格约束——社区文章反复强调deepseek-v4-pro才是 API 网关认可的生产就绪标识符,拼写错误会直接触发 400 白名单校验。迁移到 V4.1 Flash 时,务必以官方 API 模型列表为准核对新标识符,并在沙箱环境先跑通再切换生产流量。
2. 兼容性红利:OpenAI 兼容格式与开源权重。DeepSeek V4 系列兼容 OpenAI/Anthropic API 格式,Agent 框架集成成本低;同时官方完整权重以 MIT 协议开源,本地自托管完全不受 API 下线影响。仓库提供了两条自托管路径:一是 README.md 中的 vLLM/SGLang 服务化部署(含 DSpark 加速),二是 inference 目录下的原生推理代码——先用 convert.py 把 HF 权重转换为项目格式(支持 fp4/fp8 专家权重切换),再通过 generate.py 交互或批量生成:
export EXPERTS=256 export MP=4 export CONFIG=config.json python convert.py --hf-ckpt-path ${HF_CKPT_PATH} --save-path ${SAVE_PATH} --n-experts ${EXPERTS} --model-parallel ${MP} torchrun --nproc-per-node ${MP} generate.py --ckpt-path ${SAVE_PATH} --config ${CONFIG} --interactive3. 消息编码与思考模式的对齐。V4 系列不提供 Jinja 版 chat template,改用 encoding_dsv4.py 的 Python 参考实现完成 OpenAI 格式消息到模型输入串的编码与输出解析。迁移时要注意reasoning_effort三级档位(low/high/max)在 thinking 模式下通过提示词前缀生效,以及 DSML 格式工具调用的解析逻辑——这些在新版本 Flash 上大概率延续,但建议跑一遍 encoding/tests 中的官方用例做回归验证:
from encoding_dsv4 import encode_messages, parse_message_from_completion_text messages = [ {"role": "user", "content": "hello"}, {"role": "assistant", "content": "Hello! I am DeepSeek.", "reasoning_content": "thinking..."}, {"role": "user", "content": "1+1=?"} ] prompt = encode_messages(messages, thinking_mode="thinking", reasoning_effort="max")4. 成本与吞吐的再平衡。既然 V4 Pro 定价是 Flash 的三倍且即将下线,迁移后多数场景的 token 成本会显著下降;但要注意高精度复杂任务(代码语义分析、数学证明等)在新旗舰上的表现差异,建议在迁移清单中同时包含"模型标识符映射、思考模式开关、工具调用协议、成本基准、关键任务回归集"五项,逐项验证后再全量切换。
31 天,是一个模型从"最强"到"被超越"的完整周期,也是模型即服务时代版本哲学的缩影:能力标杆负责立势,规模化产品负责走量,开源的权重则负责让生命周期本身变得不那么重要。对开发者来说,与其哀叹旗舰的短暂,不如把"模型标识符可替换"写进自己的架构设计里——毕竟在 DeepSeek 的节奏下,下一任旗舰的倒计时,可能已经开始走了。
【免费下载链接】DeepSeek-V4-Pro-0813项目地址: https://ai.gitcode.com/hf_mirrors/deepseek-ai/DeepSeek-V4-Pro-0813
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考