DeepSeek V4 完整版正式發布

峰谷計費 · 1M 上下文 · SWE-bench 80.6% · API 遷移截止 7/24

DeepSeek V4 完整版 GA 正式發布 架構與定價解析

等了整整三個月,DeepSeek V4 完整版(GA 正式版)於 2026 年 7 月 20 日正式上線。若你正糾結 DeepSeek V4 和 GPT-5.6 哪個好、或仍在使用即將停用的 deepseek-chat,本文將從時間線、V4-Pro/Flash 架構、Benchmark 跑分、峰谷計費、橫向對標 Claude Fable 5,以及 7 月 24 日 API 遷移六步 Runbook給出完整結論。GA 版首次引入分時電價式峰谷計費,SWE-bench Verified 達 80.6%(開源最高),輸出價離峰僅 $0.87/M tokens資料截止:2026-07-20

01

從預覽版到完整版:DeepSeek V4 正式版發布時間線

V4 預覽版已經很強,完整版在此基礎上做了 Agent 能力、數學推理與程式碼生成的專項提升,並配套正式商業化計費體系。以下是完整時間線:

時間事件
2026-04-24V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B)
2026-05V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用
2026-06V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens),定格史上最具性價比區間
2026-06-29DeepSeek 向全體 API 使用者發郵件,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費方案
2026-07-19多位開發者獲 GA 灰度內測資格,媒體報導「完整版最快明日發布」
2026-07-20GA 正式版上線(本文發布日)
2026-07-24舊介面名 deepseek-chatdeepseek-reasoner 永久下線(北京時間 23:59)

GA 相對預覽版的核心變化:性能在 Agent/數學/程式碼上全面提升;定價從單一費率變為峰谷差異化;舊模型名將於 4 天後停用。底層 MoE 架構未變,升級重點是穩定性、最佳化與商業化紀律。

開發者當前面臨的五重痛點:

  1. 01

    舊 API 即將失效:deepseek-chatdeepseek-reasoner 7 月 24 日後永久不可存取,生產程式碼存在中斷風險。

  2. 02

    峰谷計費複雜度:工作日高峰費率翻倍,24/7 流水線若未排程,帳單可能意外上升。

  3. 03

    閉源旗艦成本:Claude Fable 5 輸出 $50/M、GPT-5.6 Sol 約 $15/M,高頻 Agent 月帳單難以承受。

  4. 04

    長上下文落地難:多數模型 1M token 僅紙面參數,KV Cache 記憶體使實際服務成本 prohibitive。

  5. 05

    資料出境合規:閉源 API 無法私有部署,企業敏感程式碼與日誌難以出境處理。

02

V4-Pro 與 V4-Flash 架構:CSA+HCA 如何撐起 100 萬 token

DeepSeek V4 拋棄 V2/V3 時代的多頭潛在注意力(MLA),採用混合注意力革新,使 1M 上下文在同等硬體上經濟可行

規格V4-ProV4-Flash
總參數量1.6 萬億(1.6T)2840 億(284B)
每 Token 啟用參數490 億(49B)130 億(13B)
Transformer 層數61 層43 層
上下文視窗1,000,000 tokens1,000,000 tokens
最大輸出384K tokens384K tokens
精度FP4(專家權重)+ FP8(其餘)FP4 + FP8 混合
預訓練資料量33T+ tokens32T+ tokens
開源協議MITMIT

壓縮稀疏注意力(CSA)+ 重度壓縮注意力(HCA)

CSA(Compressed Sparse Attention):KV 序列經 Softmax 門控池化壓縮 4 倍;FP4「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512);保留最近 128 token 滑動視窗。1M 上下文下推理 FLOPs 僅為 DeepSeek V3.2 的 27%

HCA(Heavily Compressed Attention):token 壓縮 128 倍後做全域密集注意力,捕獲長程依賴;與 CSA 交替使用(Flash 前 2 層 HCA,之後 CSA/HCA 交替;Pro 結構類似)。

綜合效果:1M token 場景 KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。

流形約束超連接(mHC)與 Muon 最佳化器

mHC 升級傳統殘差連接:引入 4 通道殘差流,透過滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,確保 61 層深網路中訊號穩定傳播。Muon 最佳化器(非 AdamW)以牛頓-舒爾茲正交化處理梯度,收斂更快、訓練更穩。

三種推理模式

模式特點適用場景
Non-think無思維鏈,極速回應簡單問答、路由分發
Think High顯式推理(思維鏈標籤)中等複雜任務、程式碼除錯
Think Max最大推理力度,需 384K+ 上下文複雜數學、長鏈路 Agent

官方推薦取樣參數全模式通用:temperature=1.0, top_p=1.0

1M token 上下文不是行銷數字——KV Cache 降至 V3.2 的 10%,才是 DeepSeek V4 能在開源 MIT 協議下提供最長上下文的技術根基。

03

Benchmark 跑分:開源大模型 2026 最新排名與性價比

V4-Pro 在多項基準創下開源權重紀錄,但與 Claude Fable 5 仍有差距——選型須結合成本。

基準測試DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6% 開源最高96.0%未單獨公佈~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified 測真實 GitHub 倉庫 Bug 修復,80.6% 與 Gemini 3.1 Pro 並列開源第一。SWE-bench Pro 更嚴格,Fable 5 的 80.3% 仍領先。

Artificial Analysis 性價比橫向對比

  • Claude Fable 5:Strategy & Ops 指數任務每次 $3.48,得分 50 分
  • DeepSeek V4-Pro:同類任務每次 $0.03,得分 38 分
  • DeepSeek V4-Flash:六類指數任務每次均低於 $0.04

Fable 5 成本是 V4-Pro 的 116 倍,得分僅高約 12 分(31%)。大多數生產場景,V4-Pro 性價比無可匹敵。

04

DeepSeek V4 對比 GPT-5.6 與 Claude Fable 5:選型矩陣

維度DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
開源 / 自架MIT,可自架閉源閉源
上下文視窗1M tokens未公開1M tokens
程式碼能力極強(接近 Fable 5)極強最強(SWE-bench Pro)
API 輸出價(離峰)$0.87/M~$15/M$50/M
峰值輸出價$1.74/M
Agent 能力強,支援多 Agent 編排最強
資料隱私可私有部署不可不可

什麼場景該用哪個模型?

  • 預算有限 / 高頻呼叫 / 私有部署:首選 V4-Pro 或 V4-Flash
  • 極致程式碼能力、不在乎成本:Claude Fable 5(SWE-bench Pro 最高分)
  • 複雜演算法 + 數學推理:GPT-5.6 Sol / Ultra
  • 超大規模日誌/文件(低成本):V4-Flash(快取命中輸入僅 $0.0028/M)

峰谷計費完整價格表

GA 版最受關注的變化:首次引入峰谷差異化定價,類似電網分時電價。高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00,費率翻倍。

模型計費項離峰(Off-Peak)高峰(Peak)
V4-Pro輸入(快取命中)¥0.025 / $0.0035 / 1M翻倍
輸入(快取未命中)¥3.00 / $0.435 / 1M¥6.00 / $0.87
輸出¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash輸入(快取命中)¥0.02 / $0.0028 / 1M翻倍
輸入(快取未命中)¥1.00 / $0.14 / 1M¥2.00 / $0.28
輸出¥2.00 / $0.28 / 1M¥4.00 / $0.56

即使高峰期,V4-Pro 輸出 $1.74/M 仍比 Claude Opus 4.8($15/M)與 GPT-5.6 Sol(約 $15/M)便宜 8.6 倍

省錢四策:① 非即時任務排到 18:00 後或 9:00 前;② 建構 Prompt Cache 提高命中率;③ 簡單任務走 V4-Flash、複雜推理升級 V4-Pro;④ 關注 DeepSeek 計費變更前 24 小時郵件通知。

05

API 遷移六步 Runbook:7 月 24 日 deepseek-chat 停用前必做

重要警告:舊模型名 deepseek-chatdeepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) 永久停止存取。

舊模型名新模型名備註
deepseek-chatdeepseek-v4-flash(非思考模式)速度快,適合輕量任務
deepseek-reasonerdeepseek-v4-flash(思考模式)或 deepseek-v4-pro更強推理選 Pro
  1. 01

    全庫搜尋舊模型名:在程式碼庫中檢索 deepseek-chatdeepseek-reasoner,含設定檔、環境變數與 CI 腳本。

  2. 02

    確定目標型號:輕量對話改 deepseek-v4-flash;需深度推理改 deepseek-v4-pro 並啟用思考模式。

  3. 03

    更新 OpenAI SDK 呼叫:僅改 model 參數,base_url 保持 https://api.deepseek.com

  4. 04

    設定思考模式(可選):透過 extra_body 傳入 thinking 設定,替代原 deepseek-reasoner 行為。

  5. 05

    Staging 驗證:在預發環境跑通核心用例,Think Max 場景確保上下文 ≥384K。

  6. 06

    生產切換與監控:7 月 24 日前完成上線,監控高峰時段帳單與錯誤率;Anthropic SDK 使用者同樣僅改 model 即可。

python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

可引用硬核資料

  • SWE-bench Verified:80.6%,當前開源模型最高分
  • KV Cache 效率:1M 上下文下僅為 V3.2 的 10% 記憶體佔用
  • 任務成本比:V4-Pro 單次 $0.03 vs Fable 5 的 $3.48(116 倍差距)
  • 峰谷價差:高峰輸出 $1.74/M,仍低於閉源旗艦 8.6 倍
  • 遷移截止:2026-07-24 23:59 北京時間

DeepSeek V4 GA 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6,而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強性能。

自架 V4 權重或跑長上下文 Agent 需要穩定算力節點——筆電難以 7×24 常駐,虛擬機器有效能損耗與合規風險。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,VpsMesh 的 Mac Mini 雲端租用通常是更優解:實體 Apple Silicon、統一記憶體適合本地推理棧(如 ds4 + DeepSeek V4 Flash 本地推理),與雲端 API 形成互補。

參考資料:DeepSeek 官方文件 · arXiv:2606.19348 · HuggingFace 模型頁 · LLMReference · Artificial Analysis · MangoMind Blog

FAQ

常見問題

工作日北京時間 09:00–12:00 與 14:00–18:00 為高峰,所有費率翻倍;其餘為離峰。V4-Pro 離峰輸出 $0.87/M,高峰 $1.74/M。批量任務建議排到非高峰,詳見 租用定價頁 了解配套開發環境成本。

7 月 24 日 23:59(北京時間)前將 deepseek-chat 改為 deepseek-v4-flashdeepseek-reasoner 改為 Flash 思考模式或 deepseek-v4-probase_url 不變,僅更新 model 參數。

Pro 為 1.6T 參數旗艦(啟用 49B),Flash 為 284B 輕量版(啟用 13B)。兩者均支援 1M 上下文;Flash 更便宜(輸出 $0.28/M),適合路由與簡單任務;Pro 推理更強,適合複雜 Agent。

Fable 5 / GPT-5.6 在最難基準上仍領先;V4-Pro 開源可自架、輸出僅 $0.87/M,是 2026 年最便宜的 frontier AI API 之一。成本敏感或需資料主權選 V4,極致程式碼能力選 Fable 5。

V4-Flash 可透過 ds4 等引擎在高端 Mac(96GB+ 統一記憶體)本地推理;完整 Pro 需叢集級硬體。部署環境設定見 說明中心

Agent 任務、數學推理與程式碼生成專項提升;引入峰谷計費;全球 GA 可用;舊模型名 7/24 下線。架構未變,重點是生產穩定性與商業化體系。