DeepSeek V4 满血版正式发布

峰谷计费 · 1M 上下文 · SWE-bench 80.6% · API 迁移截止 7/24

DeepSeek V4 满血版 GA 正式发布 架构与定价解析

等了整整三个月,DeepSeek V4 满血版(GA 正式版)于 2026 年 7 月 20 日正式上线。若你正纠结 DeepSeek V4 和 GPT-5.6 哪个好、或仍在使用即将停用的 deepseek-chat,本文将从时间线、V4-Pro/Flash 架构、Benchmark 跑分、峰谷计费、横向对标 Claude Fable 5,以及 7 月 24 日 API 迁移六步 Runbook给出完整结论。GA 版首次引入分时电价式峰谷计费,SWE-bench Verified 达 80.6%(开源最高),输出价平时仅 $0.87/M tokens数据截止:2026-07-20

01

从预览版到满血版:DeepSeek V4 正式版发布时间线

V4 预览版已经很强,满血版在此基础上做了 Agent 能力、数学推理与代码生成的专项提升,并配套正式商业化计费体系。以下是完整时间线:

时间事件
2026-04-24V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B)
2026-05V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用
2026-06V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens),定格史上最具性价比区间
2026-06-29DeepSeek 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费方案
2026-07-19多位开发者获 GA 灰度内测资格,媒体报道「满血版最快明日发布」
2026-07-20GA 正式版上线(本文发布日)
2026-07-24旧接口名 deepseek-chatdeepseek-reasoner 永久下线(北京时间 23:59)

GA 相对预览版的核心变化:性能在 Agent/数学/代码上全面提升;定价从单一费率变为峰谷差异化;旧模型名将于 4 天后停用。底层 MoE 架构未变,升级重点是稳定性、优化与商业化纪律。

开发者当前面临的五重痛点:

  1. 01

    旧 API 即将失效:deepseek-chatdeepseek-reasoner 7 月 24 日后永久不可访问,生产代码存在中断风险。

  2. 02

    峰谷计费复杂度:工作日高峰费率翻倍,24/7 流水线若未调度,账单可能意外上升。

  3. 03

    闭源旗舰成本:Claude Fable 5 输出 $50/M、GPT-5.6 Sol 约 $15/M,高频 Agent 月账单难以承受。

  4. 04

    长上下文落地难:多数模型 1M token 仅纸面参数,KV Cache 内存使实际服务成本 prohibitive。

  5. 05

    数据出境合规:闭源 API 无法私有部署,企业敏感代码与日志难以出境处理。

02

V4-Pro 与 V4-Flash 架构:CSA+HCA 如何撑起 100 万 token

DeepSeek V4 抛弃 V2/V3 时代的多头潜在注意力(MLA),采用混合注意力革新,使 1M 上下文在同等硬件上经济可行

规格V4-ProV4-Flash
总参数量1.6 万亿(1.6T)2840 亿(284B)
每 Token 激活参数490 亿(49B)130 亿(13B)
Transformer 层数61 层43 层
上下文窗口1,000,000 tokens1,000,000 tokens
最大输出384K tokens384K tokens
精度FP4(专家权重)+ FP8(其余)FP4 + FP8 混合
预训练数据量33T+ tokens32T+ tokens
开源协议MITMIT

压缩稀疏注意力(CSA)+ 重度压缩注意力(HCA)

CSA(Compressed Sparse Attention):KV 序列经 Softmax 门控池化压缩 4 倍;FP4「闪电索引器」做 top-k 稀疏选择(Pro 选 top-1024,Flash 选 top-512);保留最近 128 token 滑动窗口。1M 上下文下推理 FLOPs 仅为 DeepSeek V3.2 的 27%

HCA(Heavily Compressed Attention):token 压缩 128 倍后做全局密集注意力,捕获长程依赖;与 CSA 交替使用(Flash 前 2 层 HCA,之后 CSA/HCA 交替;Pro 结构类似)。

综合效果:1M token 场景 KV Cache 内存仅为 V3.2 的 10%(Flash 低至 7%)。

流形约束超连接(mHC)与 Muon 优化器

mHC 升级传统残差连接:引入 4 通道残差流,通过满足双随机矩阵约束(Birkhoff 多面体)的混合矩阵,确保 61 层深网络中信号稳定传播。Muon 优化器(非 AdamW)以牛顿-舒尔兹正交化处理梯度,收敛更快、训练更稳。

三种推理模式

模式特点适用场景
Non-think无思维链,极速响应简单问答、路由分发
Think High显式推理(思维链标签)中等复杂任务、代码调试
Think Max最大推理力度,需 384K+ 上下文复杂数学、长链路 Agent

官方推荐采样参数全模式通用:temperature=1.0, top_p=1.0

1M token 上下文不是营销数字——KV Cache 降至 V3.2 的 10%,才是 DeepSeek V4 能在开源 MIT 协议下提供最长上下文的技术根基。

03

Benchmark 跑分:开源大模型 2026 最新排名与性价比

V4-Pro 在多项基准创下开源权重纪录,但与 Claude Fable 5 仍有差距——选型须结合成本。

基准测试DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% 开源最高96.0%未单独公布~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified 测真实 GitHub 仓库 Bug 修复,80.6% 与 Gemini 3.1 Pro 并列开源第一。SWE-bench Pro 更严格,Fable 5 的 80.3% 仍领先。

Artificial Analysis 性价比横向对比

  • Claude Fable 5:Strategy & Ops 指数任务每次 $3.48,得分 50 分
  • DeepSeek V4-Pro:同类任务每次 $0.03,得分 38 分
  • DeepSeek V4-Flash:六类指数任务每次均低于 $0.04

Fable 5 成本是 V4-Pro 的 116 倍,得分仅高约 12 分(31%)。大多数生产场景,V4-Pro 性价比无可匹敌。

04

DeepSeek V4 对比 GPT-5.6 与 Claude Fable 5:选型矩阵

维度DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
开源 / 自托管MIT,可自托管闭源闭源
上下文窗口1M tokens未公开1M tokens
代码能力极强(接近 Fable 5)极强最强(SWE-bench Pro)
API 输出价(平时)$0.87/M~$15/M$50/M
峰值输出价$1.74/M
Agent 能力强,支持多 Agent 编排最强
数据隐私可私有部署不可不可

什么场景该用哪个模型?

  • 预算有限 / 高频调用 / 私有部署:首选 V4-Pro 或 V4-Flash
  • 极致代码能力、不在乎成本:Claude Fable 5(SWE-bench Pro 最高分)
  • 复杂算法 + 数学推理:GPT-5.6 Sol / Ultra
  • 超大规模日志/文档(低成本):V4-Flash(缓存命中输入仅 $0.0028/M)

峰谷计费完整价格表

GA 版最受关注的变化:首次引入峰谷差异化定价,类似电网分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,费率翻倍。

模型计费项平时(Off-Peak)高峰(Peak)
V4-Pro输入(缓存命中)¥0.025 / $0.0035 / 1M翻倍
输入(缓存未命中)¥3.00 / $0.435 / 1M¥6.00 / $0.87
输出¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash输入(缓存命中)¥0.02 / $0.0028 / 1M翻倍
输入(缓存未命中)¥1.00 / $0.14 / 1M¥2.00 / $0.28
输出¥2.00 / $0.28 / 1M¥4.00 / $0.56

即使高峰期,V4-Pro 输出 $1.74/M 仍比 Claude Opus 4.8($15/M)与 GPT-5.6 Sol(约 $15/M)便宜 8.6 倍

省钱四策:① 非实时任务排到 18:00 后或 9:00 前;② 构建 Prompt Cache 提高命中率;③ 简单任务走 V4-Flash、复杂推理升级 V4-Pro;④ 关注 DeepSeek 计费变更前 24 小时邮件通知。

05

API 迁移六步 Runbook:7 月 24 日 deepseek-chat 停用前必做

重要警告:旧模型名 deepseek-chatdeepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。

旧模型名新模型名备注
deepseek-chatdeepseek-v4-flash(非思考模式)速度快,适合轻量任务
deepseek-reasonerdeepseek-v4-flash(思考模式)或 deepseek-v4-pro更强推理选 Pro
  1. 01

    全库搜索旧模型名:在代码库中检索 deepseek-chatdeepseek-reasoner,含配置文件、环境变量与 CI 脚本。

  2. 02

    确定目标型号:轻量对话改 deepseek-v4-flash;需深度推理改 deepseek-v4-pro 并启用思考模式。

  3. 03

    更新 OpenAI SDK 调用:仅改 model 参数,base_url 保持 https://api.deepseek.com

  4. 04

    配置思考模式(可选):通过 extra_body 传入 thinking 配置,替代原 deepseek-reasoner 行为。

  5. 05

    Staging 验证:在预发环境跑通核心用例,Think Max 场景确保上下文 ≥384K。

  6. 06

    生产切换与监控:7 月 24 日前完成上线,监控高峰时段账单与错误率;Anthropic SDK 用户同样仅改 model 即可。

python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

可引用硬核数据

  • SWE-bench Verified:80.6%,当前开源模型最高分
  • KV Cache 效率:1M 上下文下仅为 V3.2 的 10% 内存占用
  • 任务成本比:V4-Pro 单次 $0.03 vs Fable 5 的 $3.48(116 倍差距)
  • 峰谷价差:高峰输出 $1.74/M,仍低于闭源旗舰 8.6 倍
  • 迁移截止:2026-07-24 23:59 北京时间

DeepSeek V4 GA 的价值不在于能否击败 Claude Fable 5 或 GPT-5.6,而在于以闭源旗舰 1/10 乃至 1/100 的成本,提供开源模型中无可争议的最强性能。

自托管 V4 权重或跑长上下文 Agent 需要稳定算力节点——笔记本难以 7×24 常驻,虚拟机有性能损耗与合规风险。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、统一内存适合本地推理栈(如 ds4 + DeepSeek V4 Flash 本地推理),与云端 API 形成互补。

参考资料:DeepSeek 官方文档 · arXiv:2606.19348 · HuggingFace 模型页 · LLMReference · Artificial Analysis · MangoMind Blog

FAQ

常见问题

工作日北京时间 09:00–12:00 与 14:00–18:00 为高峰,所有费率翻倍;其余为平时。V4-Pro 平时输出 $0.87/M,高峰 $1.74/M。批量任务建议排到非高峰,详见 租赁定价页 了解配套开发环境成本。

7 月 24 日 23:59(北京时间)前将 deepseek-chat 改为 deepseek-v4-flashdeepseek-reasoner 改为 Flash 思考模式或 deepseek-v4-probase_url 不变,仅更新 model 参数。

Pro 为 1.6T 参数旗舰(激活 49B),Flash 为 284B 轻量版(激活 13B)。两者均支持 1M 上下文;Flash 更便宜(输出 $0.28/M),适合路由与简单任务;Pro 推理更强,适合复杂 Agent。

Fable 5 / GPT-5.6 在最难基准上仍领先;V4-Pro 开源可自托管、输出仅 $0.87/M,是 2026 年最便宜的 frontier AI API 之一。成本敏感或需数据主权选 V4,极致代码能力选 Fable 5。

V4-Flash 可通过 ds4 等引擎在高端 Mac(96GB+ 统一内存)本地推理;完整 Pro 需集群级硬件。部署环境配置见 帮助中心

Agent 任务、数学推理与代码生成专项提升;引入峰谷计费;全球 GA 可用;旧模型名 7/24 下线。架构未变,重点是生产稳定性与商业化体系。