DeepSeek V4 Flash 正式版評測

0731 後訓練升級 · Harness 框架 · 競品橫比 · 跑分爭議 · Pro 版何時上線

DeepSeek V4 Flash 正式版大模型評測與 API 定價對比

2026 年 7 月 31 日,DeepSeekV4-Flash-0731 升級爲官方正式版:參數規模不變(284B / 13B 激活),僅靠後訓練就在多項 Agent 基準上反超自家更大的 V4-Pro 預覽版,價格僅爲 Claude Opus 4.8 的幾十分之一。若你正糾結「跑分是否可信」「與 Kimi K3Qwen3.8-Max 如何選型」,或需遷移已停用的 deepseek-chat,本文將用時間線、核心定價表、Harness 拆解、橫向對比、六步 Runbook 與跑分爭議標註給出可執行結論。數據截止:2026-08-05

01

從 4 月預覽到 7 月「官方版」:三個月時間線

這不是一次新模型發佈,而是同一個 284B 參數模型重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發佈」狀態,沒有確切日期。

  1. 01

    2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發佈並開源,含 V4-Pro(1.6T / 49B 激活)與 V4-Flash(284B / 13B 激活),均支持 100 萬 token 上下文,MIT 協議。詳見 V4 滿血版 GA 解讀

  2. 02

    7 月 24 日:舊接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換到 V4 系列命名。

  3. 03

    7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力。詳見 Kimi K3 全面開源解讀

  4. 04

    7 月 31 日:V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架 Harness,稱即將隨 V4 正式版發佈。僅限 API,App 和網頁端暫未同步。

  5. 05

    8 月 2 日:阿里 Qwen3.8-Max API GA,權重待放出。詳見 Qwen3.8-Max 發佈解讀

  6. 06

    截至 8 月 5 日:V4-Pro 官方版仍是「儘快發佈」。有媒體援引未署名消息源稱 8 月 10–20 日 GA——未經 DeepSeek 官方證實,僅供參考

跟進此類發佈時,常見五重盲區:

  1. 01

    誤讀「正式版」:架構與參數與 4 月預覽版完全相同,性能提升完全來自後訓練。

  2. 02

    跑分框架依賴:Agent 類跑分全部基於尚未公開的 Harness「極簡模式」測得。

  3. 03

    API-only 限制:消費者 App / 網頁聊天尚未更新到 0731 版本。

  4. 04

    Pro 版空窗:旗艦 V4-Pro 官方版仍未上線,複雜推理任務需繼續用預覽版。

  5. 05

    融資傳聞:約 74 億美元融資、487 億美元估值等報道均來自財經媒體「消息人士」,尚無官方或監管備案確認。

02

核心數據一覽:定價、參數與協議

模型狀態總/激活參數上下文輸入(未命中/命中,$/M)輸出($/M)協議
DeepSeek-V4-Flash-0731官方正式版(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro預覽版(4/24,官方版未發佈)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3權重開源(7/27)2.8T / ~104B(社區估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2開源(2026 年 6 月)~744B / ~40B1M未覈實未覈實MIT
Qwen3.8-MaxAPI GA(8/2),權重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承諾開源

以上定價均爲廠商公開數據。DeepSeek 已預告未來將對 API 啓用「高峯時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公佈具體生效日期。對比 Claude Opus 4.8:快取未命中輸入約便宜 36 倍,快取命中約 179 倍,輸出約 89 倍(據 21 世紀經濟報道轉引官方定價)。

03

後訓練升級與 Harness:性能是怎麼「變出來」的

架構沒有變,變的是後訓練

V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,官方明確說明性能提升「完全來自重新進行的後訓練」。284B 總參數、13B 激活參數的 Flash 版本,在多項 Agent 基準上反而超過了參數量是自己好幾倍的 V4-Pro 預覽版——印證 2026 年下半年大模型競爭中,後訓練質量的重要性正在逼近甚至超過單純堆參數。

混合注意力:CSA + HCA、mHC、Muon 優化器

根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構三處關鍵改動:

  1. 01

    混合注意力(DSA):結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),降低長上下文計算與顯存開銷。

  2. 02

    流形約束超連接(mHC):對傳統殘差連接結構做了改進。

  3. 03

    Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。

官方指標:100 萬 token 上下文下,V4-Pro 相比 V3.2 單 token 推理 FLOPs 僅爲 27%,KV Cache 佔用僅爲 10%——尚未看到獨立第三方復現驗證。

Harness:DeepSeek 自研 Agent 框架首次亮相

7 月 31 日 changelog 首次出現 DeepSeek Harness——自研 Agent 執行框架,用於讀寫文件、調用工具、執行命令,對標 Claude Code。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「極簡模式」測出,官方亦提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」

04

橫向對比與跑分爭議:中國開源大模型「六邊形混戰」

模型實驗室Intelligence Index(Artificial Analysis)單任務平均成本DeepSeek 官方 Agent 跑分
V4-Flash-0731DeepSeek50$0.03Terminal Bench 2.0:82.7(Harness 極簡模式)
Kimi K3月之暗面57$0.86
GLM-5.2智譜比 V4-Flash 高約 1 分未覈實
GPT-5.6 SolOpenAI高 9+ 分$1.86閉源
Claude Fable 5Anthropic高 9+ 分$3.15閉源

DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——單任務成本僅爲 Kimi K3 的約 1/29、Claude Fable 5 的約 1/105。

跑分水分需標註:① Terminal Bench 2.0 的 82.7 分(vs V4-Pro 預覽版 67.9)基於未公開的 Harness 極簡模式,參數 max 檔、top_p=0.95、temperature=1.0;② 海外開發者反饋輸入快取命中率偏低、安全分類器偶發超時;③ V4-Pro / Harness 上線日期僅爲媒體傳言;④ 融資/IPO 報道均未經官方證實。

05

六步 API 選型 Runbook:從遷移到生產路由

V4-Flash-0731 已兼容 OpenAI / Anthropic 格式 API,可直接接入 Claude Code、OpenCode、Cursor 等 Agent 工具鏈。以下爲從零評估到生產的六步 Runbook:

  1. 01

    審計存量調用:排查代碼中是否仍使用已停用的 deepseek-chat / deepseek-reasoner,統計月調用量與快取命中率基線。

  2. 02

    切換模型命名:deepseek-chat 改爲 deepseek-v4-flash(非 thinking);deepseek-reasoner 改爲 Flash thinking 模式或 deepseek-v4-pro 預覽版。base URL 無需變更。

  3. 03

    評估快取策略:關注輸入快取命中率——海外社區反饋正式版快取命中率偏低,直接影響賬單;長上下文任務優先測試 Prompt Caching 效果。

  4. 04

    A/B 競品對照:用自有業務樣本對比 Kimi K3($3/$15)、Qwen3.8-Max($2/$6)與 V4-Flash($0.14/$0.28)的延遲、成功率與單任務成本。

  5. 05

    配置 Agent 宿主:Harness 尚未公開,生產環境可暫用 Claude Code / OpenCode 作爲執行框架;待 Harness GA 後複測 Terminal Bench 類任務表現。

  6. 06

    建立主備路由與監控:高頻批量任務走 V4-Flash;複雜推理保留 V4-Pro 預覽版或 Claude 作爲 fallback;設置成本上限與高峯時段 2 倍加價預警。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析這段代碼..."}]
)
06

行業背景、硬核數據與選型收束

  • 「斬殺線」效應:中文開發者社區流傳的說法——DeepSeek 以「夠用性能 + 極端低價」給同行設下門檻;這也解釋了 GPT-5.6 Luna 一次性降價 80% 等密集調價動作。
  • 社區情緒反轉:Pro 版遲遲未兌現時,梁文鋒被戲稱「梁白開」;Flash 0731 超預期後又稱「梁聖」——觀察中國 AI 社區情緒的有趣側面。
  • 算力股反應鈍化:7 月 31 日英偉達、博通、AMD 未明顯波動——市場已習慣「DeepSeek 式效率突破」,與 2025 年初 R1 引發芯片股大跌形成對比。
  • OpenRouter 調用量:V4-Flash 預覽版曾連續七週穩坐 OpenRouter 調用量第一,印證「大規模低成本 Agent 調用」纔是其核心用戶羣。
  • Terminal Bench 2.0:官方報 82.7 分 vs V4-Pro 預覽版 67.9——但測試框架爲未公開 Harness,獨立復現前應視爲廠商自報。

純 API 調用可接入 V4-Flash 做大規模 Agent 推理,但 iOS 簽名鏈、Xcode 本地構建、Metal 推理與 7×24 Agent 長跑仍依賴實體 macOS 節點——筆記本難以穩定常駐 OpenClaw / Claude Code 宿主,虛擬機則有性能損耗與 EULA 風險。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,VpsMesh 的 Mac Mini 雲端租賃通常是更優解:實體 Apple Silicon、root 權限與可預測月租,可與 DeepSeek API 形成「雲端推理 + 本地構建」互補架構。本地推理方案另見 ds4 + V4 Flash 本地推理指南

參考資料:DeepSeek 官方 API 文檔與 changelog · 技術報告 · Artificial Analysis · 21 世紀經濟報道 · 快科技 · V2EX 社區討論。發佈前請以官方最新定價、跑分及 V4-Pro/Harness 上線狀態爲準。

FAQ

常見問題

原生支持 100 萬 token 上下文,且長上下文場景下計算與顯存開銷大幅降低(官方數據:V4-Pro 在百萬 token 下 FLOPs 僅爲 V3.2 的 27%,KV Cache 僅爲 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。

普通對話、批量處理或大規模低成本 Agent 流水線,V4-Flash-0731 性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。更深世界知識或複雜推理、預算不敏感時,可先用 V4-Pro 預覽版,等官方版上線後再評估。

截至 2026 年 8 月 5 日還不能。目前上線的官方版只有 V4-Flash-0731,且僅限 API。V4-Pro 官方版和 Harness 官方口徑是「儘快發佈」,網上流傳的 8 月 10–20 日等具體時間是未經證實的傳言。部署 Agent 宿主可參考 Mac Mini M4 租賃定價

建議區分對待。SWE-bench Verified 等被廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分基於未公開的 Harness 測得,官方也提示對框架選擇高度敏感——建議等社區用 Claude Code、Cursor 等獨立復現後再下結論。

若用 OpenAI / Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新官方版本。若仍用已停用的 deepseek-chat / deepseek-reasoner,需儘快切換。更多部署細節見 幫助中心