峰谷计费 · 1M 上下文 · SWE-bench 80.6% · API 迁移截止 7/24
等了整整三个月,DeepSeek V4 满血版(GA 正式版)于 2026 年 7 月 20 日正式上线。若你正纠结 DeepSeek V4 和 GPT-5.6 哪个好、或仍在使用即将停用的 deepseek-chat,本文将从时间线、V4-Pro/Flash 架构、Benchmark 跑分、峰谷计费、横向对标 Claude Fable 5,以及 7 月 24 日 API 迁移六步 Runbook给出完整结论。GA 版首次引入分时电价式峰谷计费,SWE-bench Verified 达 80.6%(开源最高),输出价平时仅 $0.87/M tokens。数据截止:2026-07-20
V4 预览版已经很强,满血版在此基础上做了 Agent 能力、数学推理与代码生成的专项提升,并配套正式商业化计费体系。以下是完整时间线:
| 时间 | 事件 |
|---|---|
| 2026-04-24 | V4 预览版上线 + 开源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 与 V4-Pro 生产调优版本上线,API 正式可用 |
| 2026-06 | V4-Pro 价格永久降价 75%(输出价 $0.87/M tokens),定格史上最具性价比区间 |
| 2026-06-29 | DeepSeek 向全体 API 用户发邮件,宣布 GA 将于 7 月中旬上线,首次披露峰谷计费方案 |
| 2026-07-19 | 多位开发者获 GA 灰度内测资格,媒体报道「满血版最快明日发布」 |
| 2026-07-20 | GA 正式版上线(本文发布日) |
| 2026-07-24 | 旧接口名 deepseek-chat 与 deepseek-reasoner 永久下线(北京时间 23:59) |
GA 相对预览版的核心变化:性能在 Agent/数学/代码上全面提升;定价从单一费率变为峰谷差异化;旧模型名将于 4 天后停用。底层 MoE 架构未变,升级重点是稳定性、优化与商业化纪律。
开发者当前面临的五重痛点:
旧 API 即将失效:deepseek-chat 与 deepseek-reasoner 7 月 24 日后永久不可访问,生产代码存在中断风险。
峰谷计费复杂度:工作日高峰费率翻倍,24/7 流水线若未调度,账单可能意外上升。
闭源旗舰成本:Claude Fable 5 输出 $50/M、GPT-5.6 Sol 约 $15/M,高频 Agent 月账单难以承受。
长上下文落地难:多数模型 1M token 仅纸面参数,KV Cache 内存使实际服务成本 prohibitive。
数据出境合规:闭源 API 无法私有部署,企业敏感代码与日志难以出境处理。
DeepSeek V4 抛弃 V2/V3 时代的多头潜在注意力(MLA),采用混合注意力革新,使 1M 上下文在同等硬件上经济可行。
| 规格 | V4-Pro | V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿(1.6T) | 2840 亿(284B) |
| 每 Token 激活参数 | 490 亿(49B) | 130 亿(13B) |
| Transformer 层数 | 61 层 | 43 层 |
| 上下文窗口 | 1,000,000 tokens | 1,000,000 tokens |
| 最大输出 | 384K tokens | 384K tokens |
| 精度 | FP4(专家权重)+ FP8(其余) | FP4 + FP8 混合 |
| 预训练数据量 | 33T+ tokens | 32T+ tokens |
| 开源协议 | MIT | MIT |
CSA(Compressed Sparse Attention):KV 序列经 Softmax 门控池化压缩 4 倍;FP4「闪电索引器」做 top-k 稀疏选择(Pro 选 top-1024,Flash 选 top-512);保留最近 128 token 滑动窗口。1M 上下文下推理 FLOPs 仅为 DeepSeek V3.2 的 27%。
HCA(Heavily Compressed Attention):token 压缩 128 倍后做全局密集注意力,捕获长程依赖;与 CSA 交替使用(Flash 前 2 层 HCA,之后 CSA/HCA 交替;Pro 结构类似)。
综合效果:1M token 场景 KV Cache 内存仅为 V3.2 的 10%(Flash 低至 7%)。
mHC 升级传统残差连接:引入 4 通道残差流,通过满足双随机矩阵约束(Birkhoff 多面体)的混合矩阵,确保 61 层深网络中信号稳定传播。Muon 优化器(非 AdamW)以牛顿-舒尔兹正交化处理梯度,收敛更快、训练更稳。
| 模式 | 特点 | 适用场景 |
|---|---|---|
| Non-think | 无思维链,极速响应 | 简单问答、路由分发 |
| Think High | 显式推理(思维链标签) | 中等复杂任务、代码调试 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 复杂数学、长链路 Agent |
官方推荐采样参数全模式通用:temperature=1.0, top_p=1.0。
1M token 上下文不是营销数字——KV Cache 降至 V3.2 的 10%,才是 DeepSeek V4 能在开源 MIT 协议下提供最长上下文的技术根基。
V4-Pro 在多项基准创下开源权重纪录,但与 Claude Fable 5 仍有差距——选型须结合成本。
| 基准测试 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% 开源最高 | 96.0% | 未单独公布 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 测真实 GitHub 仓库 Bug 修复,80.6% 与 Gemini 3.1 Pro 并列开源第一。SWE-bench Pro 更严格,Fable 5 的 80.3% 仍领先。
Fable 5 成本是 V4-Pro 的 116 倍,得分仅高约 12 分(31%)。大多数生产场景,V4-Pro 性价比无可匹敌。
| 维度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 开源 / 自托管 | MIT,可自托管 | 闭源 | 闭源 |
| 上下文窗口 | 1M tokens | 未公开 | 1M tokens |
| 代码能力 | 极强(接近 Fable 5) | 极强 | 最强(SWE-bench Pro) |
| API 输出价(平时) | $0.87/M | ~$15/M | $50/M |
| 峰值输出价 | $1.74/M | — | — |
| Agent 能力 | 强,支持多 Agent 编排 | 强 | 最强 |
| 数据隐私 | 可私有部署 | 不可 | 不可 |
GA 版最受关注的变化:首次引入峰谷差异化定价,类似电网分时电价。高峰时段(北京时间):工作日 09:00–12:00 和 14:00–18:00,费率翻倍。
| 模型 | 计费项 | 平时(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 输入(缓存命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 输出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 输入(缓存命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 输入(缓存未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 输出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
即使高峰期,V4-Pro 输出 $1.74/M 仍比 Claude Opus 4.8($15/M)与 GPT-5.6 Sol(约 $15/M)便宜 8.6 倍。
省钱四策:① 非实时任务排到 18:00 后或 9:00 前;② 构建 Prompt Cache 提高命中率;③ 简单任务走 V4-Flash、复杂推理升级 V4-Pro;④ 关注 DeepSeek 计费变更前 24 小时邮件通知。
重要警告:旧模型名 deepseek-chat 和 deepseek-reasoner 将于 2026 年 7 月 24 日 15:59 UTC(北京时间 7 月 24 日 23:59) 永久停止访问。
| 旧模型名 | 新模型名 | 备注 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,适合轻量任务 |
deepseek-reasoner | deepseek-v4-flash(思考模式)或 deepseek-v4-pro | 更强推理选 Pro |
全库搜索旧模型名:在代码库中检索 deepseek-chat 与 deepseek-reasoner,含配置文件、环境变量与 CI 脚本。
确定目标型号:轻量对话改 deepseek-v4-flash;需深度推理改 deepseek-v4-pro 并启用思考模式。
更新 OpenAI SDK 调用:仅改 model 参数,base_url 保持 https://api.deepseek.com。
配置思考模式(可选):通过 extra_body 传入 thinking 配置,替代原 deepseek-reasoner 行为。
Staging 验证:在预发环境跑通核心用例,Think Max 场景确保上下文 ≥384K。
生产切换与监控:7 月 24 日前完成上线,监控高峰时段账单与错误率;Anthropic SDK 用户同样仅改 model 即可。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
DeepSeek V4 GA 的价值不在于能否击败 Claude Fable 5 或 GPT-5.6,而在于以闭源旗舰 1/10 乃至 1/100 的成本,提供开源模型中无可争议的最强性能。
自托管 V4 权重或跑长上下文 Agent 需要稳定算力节点——笔记本难以 7×24 常驻,虚拟机有性能损耗与合规风险。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、统一内存适合本地推理栈(如 ds4 + DeepSeek V4 Flash 本地推理),与云端 API 形成互补。
参考资料:DeepSeek 官方文档 · arXiv:2606.19348 · HuggingFace 模型页 · LLMReference · Artificial Analysis · MangoMind Blog
工作日北京时间 09:00–12:00 与 14:00–18:00 为高峰,所有费率翻倍;其余为平时。V4-Pro 平时输出 $0.87/M,高峰 $1.74/M。批量任务建议排到非高峰,详见 租赁定价页 了解配套开发环境成本。
7 月 24 日 23:59(北京时间)前将 deepseek-chat 改为 deepseek-v4-flash,deepseek-reasoner 改为 Flash 思考模式或 deepseek-v4-pro。base_url 不变,仅更新 model 参数。
Pro 为 1.6T 参数旗舰(激活 49B),Flash 为 284B 轻量版(激活 13B)。两者均支持 1M 上下文;Flash 更便宜(输出 $0.28/M),适合路由与简单任务;Pro 推理更强,适合复杂 Agent。
Fable 5 / GPT-5.6 在最难基准上仍领先;V4-Pro 开源可自托管、输出仅 $0.87/M,是 2026 年最便宜的 frontier AI API 之一。成本敏感或需数据主权选 V4,极致代码能力选 Fable 5。
V4-Flash 可通过 ds4 等引擎在高端 Mac(96GB+ 统一内存)本地推理;完整 Pro 需集群级硬件。部署环境配置见 帮助中心。
Agent 任务、数学推理与代码生成专项提升;引入峰谷计费;全球 GA 可用;旧模型名 7/24 下线。架构未变,重点是生产稳定性与商业化体系。