峰谷計費 · 1M 上下文 · SWE-bench 80.6% · API 遷移截止 7/24
等了整整三個月,DeepSeek V4 完整版(GA 正式版)於 2026 年 7 月 20 日正式上線。若你正糾結 DeepSeek V4 和 GPT-5.6 哪個好、或仍在使用即將停用的 deepseek-chat,本文將從時間線、V4-Pro/Flash 架構、Benchmark 跑分、峰谷計費、橫向對標 Claude Fable 5,以及 7 月 24 日 API 遷移六步 Runbook給出完整結論。GA 版首次引入分時電價式峰谷計費,SWE-bench Verified 達 80.6%(開源最高),輸出價離峰僅 $0.87/M tokens。資料截止:2026-07-20
V4 預覽版已經很強,完整版在此基礎上做了 Agent 能力、數學推理與程式碼生成的專項提升,並配套正式商業化計費體系。以下是完整時間線:
| 時間 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版上線 + 開源(MIT),含 V4-Pro(1.6T)和 V4-Flash(284B) |
| 2026-05 | V4-Flash 與 V4-Pro 生產調優版本上線,API 正式可用 |
| 2026-06 | V4-Pro 價格永久降價 75%(輸出價 $0.87/M tokens),定格史上最具性價比區間 |
| 2026-06-29 | DeepSeek 向全體 API 使用者發郵件,宣布 GA 將於 7 月中旬上線,首次披露峰谷計費方案 |
| 2026-07-19 | 多位開發者獲 GA 灰度內測資格,媒體報導「完整版最快明日發布」 |
| 2026-07-20 | GA 正式版上線(本文發布日) |
| 2026-07-24 | 舊介面名 deepseek-chat 與 deepseek-reasoner 永久下線(北京時間 23:59) |
GA 相對預覽版的核心變化:性能在 Agent/數學/程式碼上全面提升;定價從單一費率變為峰谷差異化;舊模型名將於 4 天後停用。底層 MoE 架構未變,升級重點是穩定性、最佳化與商業化紀律。
開發者當前面臨的五重痛點:
舊 API 即將失效:deepseek-chat 與 deepseek-reasoner 7 月 24 日後永久不可存取,生產程式碼存在中斷風險。
峰谷計費複雜度:工作日高峰費率翻倍,24/7 流水線若未排程,帳單可能意外上升。
閉源旗艦成本:Claude Fable 5 輸出 $50/M、GPT-5.6 Sol 約 $15/M,高頻 Agent 月帳單難以承受。
長上下文落地難:多數模型 1M token 僅紙面參數,KV Cache 記憶體使實際服務成本 prohibitive。
資料出境合規:閉源 API 無法私有部署,企業敏感程式碼與日誌難以出境處理。
DeepSeek V4 拋棄 V2/V3 時代的多頭潛在注意力(MLA),採用混合注意力革新,使 1M 上下文在同等硬體上經濟可行。
| 規格 | V4-Pro | V4-Flash |
|---|---|---|
| 總參數量 | 1.6 萬億(1.6T) | 2840 億(284B) |
| 每 Token 啟用參數 | 490 億(49B) | 130 億(13B) |
| Transformer 層數 | 61 層 | 43 層 |
| 上下文視窗 | 1,000,000 tokens | 1,000,000 tokens |
| 最大輸出 | 384K tokens | 384K tokens |
| 精度 | FP4(專家權重)+ FP8(其餘) | FP4 + FP8 混合 |
| 預訓練資料量 | 33T+ tokens | 32T+ tokens |
| 開源協議 | MIT | MIT |
CSA(Compressed Sparse Attention):KV 序列經 Softmax 門控池化壓縮 4 倍;FP4「閃電索引器」做 top-k 稀疏選擇(Pro 選 top-1024,Flash 選 top-512);保留最近 128 token 滑動視窗。1M 上下文下推理 FLOPs 僅為 DeepSeek V3.2 的 27%。
HCA(Heavily Compressed Attention):token 壓縮 128 倍後做全域密集注意力,捕獲長程依賴;與 CSA 交替使用(Flash 前 2 層 HCA,之後 CSA/HCA 交替;Pro 結構類似)。
綜合效果:1M token 場景 KV Cache 記憶體僅為 V3.2 的 10%(Flash 低至 7%)。
mHC 升級傳統殘差連接:引入 4 通道殘差流,透過滿足雙隨機矩陣約束(Birkhoff 多面體)的混合矩陣,確保 61 層深網路中訊號穩定傳播。Muon 最佳化器(非 AdamW)以牛頓-舒爾茲正交化處理梯度,收斂更快、訓練更穩。
| 模式 | 特點 | 適用場景 |
|---|---|---|
| Non-think | 無思維鏈,極速回應 | 簡單問答、路由分發 |
| Think High | 顯式推理(思維鏈標籤) | 中等複雜任務、程式碼除錯 |
| Think Max | 最大推理力度,需 384K+ 上下文 | 複雜數學、長鏈路 Agent |
官方推薦取樣參數全模式通用:temperature=1.0, top_p=1.0。
1M token 上下文不是行銷數字——KV Cache 降至 V3.2 的 10%,才是 DeepSeek V4 能在開源 MIT 協議下提供最長上下文的技術根基。
V4-Pro 在多項基準創下開源權重紀錄,但與 Claude Fable 5 仍有差距——選型須結合成本。
| 基準測試 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% 開源最高 | 96.0% | 未單獨公佈 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified 測真實 GitHub 倉庫 Bug 修復,80.6% 與 Gemini 3.1 Pro 並列開源第一。SWE-bench Pro 更嚴格,Fable 5 的 80.3% 仍領先。
Fable 5 成本是 V4-Pro 的 116 倍,得分僅高約 12 分(31%)。大多數生產場景,V4-Pro 性價比無可匹敵。
| 維度 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 開源 / 自架 | MIT,可自架 | 閉源 | 閉源 |
| 上下文視窗 | 1M tokens | 未公開 | 1M tokens |
| 程式碼能力 | 極強(接近 Fable 5) | 極強 | 最強(SWE-bench Pro) |
| API 輸出價(離峰) | $0.87/M | ~$15/M | $50/M |
| 峰值輸出價 | $1.74/M | — | — |
| Agent 能力 | 強,支援多 Agent 編排 | 強 | 最強 |
| 資料隱私 | 可私有部署 | 不可 | 不可 |
GA 版最受關注的變化:首次引入峰谷差異化定價,類似電網分時電價。高峰時段(北京時間):工作日 09:00–12:00 和 14:00–18:00,費率翻倍。
| 模型 | 計費項 | 離峰(Off-Peak) | 高峰(Peak) |
|---|---|---|---|
| V4-Pro | 輸入(快取命中) | ¥0.025 / $0.0035 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 輸出 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 輸入(快取命中) | ¥0.02 / $0.0028 / 1M | 翻倍 |
| 輸入(快取未命中) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 輸出 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
即使高峰期,V4-Pro 輸出 $1.74/M 仍比 Claude Opus 4.8($15/M)與 GPT-5.6 Sol(約 $15/M)便宜 8.6 倍。
省錢四策:① 非即時任務排到 18:00 後或 9:00 前;② 建構 Prompt Cache 提高命中率;③ 簡單任務走 V4-Flash、複雜推理升級 V4-Pro;④ 關注 DeepSeek 計費變更前 24 小時郵件通知。
重要警告:舊模型名 deepseek-chat 和 deepseek-reasoner 將於 2026 年 7 月 24 日 15:59 UTC(北京時間 7 月 24 日 23:59) 永久停止存取。
| 舊模型名 | 新模型名 | 備註 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考模式) | 速度快,適合輕量任務 |
deepseek-reasoner | deepseek-v4-flash(思考模式)或 deepseek-v4-pro | 更強推理選 Pro |
全庫搜尋舊模型名:在程式碼庫中檢索 deepseek-chat 與 deepseek-reasoner,含設定檔、環境變數與 CI 腳本。
確定目標型號:輕量對話改 deepseek-v4-flash;需深度推理改 deepseek-v4-pro 並啟用思考模式。
更新 OpenAI SDK 呼叫:僅改 model 參數,base_url 保持 https://api.deepseek.com。
設定思考模式(可選):透過 extra_body 傳入 thinking 設定,替代原 deepseek-reasoner 行為。
Staging 驗證:在預發環境跑通核心用例,Think Max 場景確保上下文 ≥384K。
生產切換與監控:7 月 24 日前完成上線,監控高峰時段帳單與錯誤率;Anthropic SDK 使用者同樣僅改 model 即可。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
DeepSeek V4 GA 的價值不在於能否擊敗 Claude Fable 5 或 GPT-5.6,而在於以閉源旗艦 1/10 乃至 1/100 的成本,提供開源模型中無可爭議的最強性能。
自架 V4 權重或跑長上下文 Agent 需要穩定算力節點——筆電難以 7×24 常駐,虛擬機器有效能損耗與合規風險。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,VpsMesh 的 Mac Mini 雲端租用通常是更優解:實體 Apple Silicon、統一記憶體適合本地推理棧(如 ds4 + DeepSeek V4 Flash 本地推理),與雲端 API 形成互補。
參考資料:DeepSeek 官方文件 · arXiv:2606.19348 · HuggingFace 模型頁 · LLMReference · Artificial Analysis · MangoMind Blog
工作日北京時間 09:00–12:00 與 14:00–18:00 為高峰,所有費率翻倍;其餘為離峰。V4-Pro 離峰輸出 $0.87/M,高峰 $1.74/M。批量任務建議排到非高峰,詳見 租用定價頁 了解配套開發環境成本。
7 月 24 日 23:59(北京時間)前將 deepseek-chat 改為 deepseek-v4-flash,deepseek-reasoner 改為 Flash 思考模式或 deepseek-v4-pro。base_url 不變,僅更新 model 參數。
Pro 為 1.6T 參數旗艦(啟用 49B),Flash 為 284B 輕量版(啟用 13B)。兩者均支援 1M 上下文;Flash 更便宜(輸出 $0.28/M),適合路由與簡單任務;Pro 推理更強,適合複雜 Agent。
Fable 5 / GPT-5.6 在最難基準上仍領先;V4-Pro 開源可自架、輸出僅 $0.87/M,是 2026 年最便宜的 frontier AI API 之一。成本敏感或需資料主權選 V4,極致程式碼能力選 Fable 5。
V4-Flash 可透過 ds4 等引擎在高端 Mac(96GB+ 統一記憶體)本地推理;完整 Pro 需叢集級硬體。部署環境設定見 說明中心。
Agent 任務、數學推理與程式碼生成專項提升;引入峰谷計費;全球 GA 可用;舊模型名 7/24 下線。架構未變,重點是生產穩定性與商業化體系。