0731 後訓練升級 · Harness 框架 · 競品橫比 · 跑分爭議 · Pro 版何時上線
2026 年 7 月 31 日,DeepSeek 將 V4-Flash-0731 升級爲官方正式版:參數規模不變(284B / 13B 激活),僅靠後訓練就在多項 Agent 基準上反超自家更大的 V4-Pro 預覽版,價格僅爲 Claude Opus 4.8 的幾十分之一。若你正糾結「跑分是否可信」「與 Kimi K3、Qwen3.8-Max 如何選型」,或需遷移已停用的 deepseek-chat,本文將用時間線、核心定價表、Harness 拆解、橫向對比、六步 Runbook 與跑分爭議標註給出可執行結論。數據截止:2026-08-05
這不是一次新模型發佈,而是同一個 284B 參數模型重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發佈」狀態,沒有確切日期。
2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發佈並開源,含 V4-Pro(1.6T / 49B 激活)與 V4-Flash(284B / 13B 激活),均支持 100 萬 token 上下文,MIT 協議。詳見 V4 滿血版 GA 解讀。
7 月 24 日:舊接口 deepseek-chat 與 deepseek-reasoner 正式停用,全部流量切換到 V4 系列命名。
7 月 27 日:月之暗面 Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力。詳見 Kimi K3 全面開源解讀。
7 月 31 日:V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架 Harness,稱即將隨 V4 正式版發佈。僅限 API,App 和網頁端暫未同步。
8 月 2 日:阿里 Qwen3.8-Max API GA,權重待放出。詳見 Qwen3.8-Max 發佈解讀。
截至 8 月 5 日:V4-Pro 官方版仍是「儘快發佈」。有媒體援引未署名消息源稱 8 月 10–20 日 GA——未經 DeepSeek 官方證實,僅供參考。
跟進此類發佈時,常見五重盲區:
誤讀「正式版」:架構與參數與 4 月預覽版完全相同,性能提升完全來自後訓練。
跑分框架依賴:Agent 類跑分全部基於尚未公開的 Harness「極簡模式」測得。
API-only 限制:消費者 App / 網頁聊天尚未更新到 0731 版本。
Pro 版空窗:旗艦 V4-Pro 官方版仍未上線,複雜推理任務需繼續用預覽版。
融資傳聞:約 74 億美元融資、487 億美元估值等報道均來自財經媒體「消息人士」,尚無官方或監管備案確認。
| 模型 | 狀態 | 總/激活參數 | 上下文 | 輸入(未命中/命中,$/M) | 輸出($/M) | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(4/24,官方版未發佈) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(7/27) | 2.8T / ~104B(社區估算) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 開源(2026 年 6 月) | ~744B / ~40B | 1M | 未覈實 | 未覈實 | MIT |
| Qwen3.8-Max | API GA(8/2),權重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源 |
以上定價均爲廠商公開數據。DeepSeek 已預告未來將對 API 啓用「高峯時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公佈具體生效日期。對比 Claude Opus 4.8:快取未命中輸入約便宜 36 倍,快取命中約 179 倍,輸出約 89 倍(據 21 世紀經濟報道轉引官方定價)。
V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,官方明確說明性能提升「完全來自重新進行的後訓練」。284B 總參數、13B 激活參數的 Flash 版本,在多項 Agent 基準上反而超過了參數量是自己好幾倍的 V4-Pro 預覽版——印證 2026 年下半年大模型競爭中,後訓練質量的重要性正在逼近甚至超過單純堆參數。
根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構三處關鍵改動:
混合注意力(DSA):結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),降低長上下文計算與顯存開銷。
流形約束超連接(mHC):對傳統殘差連接結構做了改進。
Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。
官方指標:100 萬 token 上下文下,V4-Pro 相比 V3.2 單 token 推理 FLOPs 僅爲 27%,KV Cache 佔用僅爲 10%——尚未看到獨立第三方復現驗證。
7 月 31 日 changelog 首次出現 DeepSeek Harness——自研 Agent 執行框架,用於讀寫文件、調用工具、執行命令,對標 Claude Code。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「極簡模式」測出,官方亦提示:「跑分對 harness 選擇非常敏感,不能簡單等同於模型本身能力的提升。」
| 模型 | 實驗室 | Intelligence Index(Artificial Analysis) | 單任務平均成本 | DeepSeek 官方 Agent 跑分 |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 | Terminal Bench 2.0:82.7(Harness 極簡模式) |
| Kimi K3 | 月之暗面 | 57 | $0.86 | — |
| GLM-5.2 | 智譜 | 比 V4-Flash 高約 1 分 | 未覈實 | — |
| GPT-5.6 Sol | OpenAI | 高 9+ 分 | $1.86 | 閉源 |
| Claude Fable 5 | Anthropic | 高 9+ 分 | $3.15 | 閉源 |
DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——單任務成本僅爲 Kimi K3 的約 1/29、Claude Fable 5 的約 1/105。
跑分水分需標註:① Terminal Bench 2.0 的 82.7 分(vs V4-Pro 預覽版 67.9)基於未公開的 Harness 極簡模式,參數 max 檔、top_p=0.95、temperature=1.0;② 海外開發者反饋輸入快取命中率偏低、安全分類器偶發超時;③ V4-Pro / Harness 上線日期僅爲媒體傳言;④ 融資/IPO 報道均未經官方證實。
V4-Flash-0731 已兼容 OpenAI / Anthropic 格式 API,可直接接入 Claude Code、OpenCode、Cursor 等 Agent 工具鏈。以下爲從零評估到生產的六步 Runbook:
審計存量調用:排查代碼中是否仍使用已停用的 deepseek-chat / deepseek-reasoner,統計月調用量與快取命中率基線。
切換模型命名:將 deepseek-chat 改爲 deepseek-v4-flash(非 thinking);deepseek-reasoner 改爲 Flash thinking 模式或 deepseek-v4-pro 預覽版。base URL 無需變更。
評估快取策略:關注輸入快取命中率——海外社區反饋正式版快取命中率偏低,直接影響賬單;長上下文任務優先測試 Prompt Caching 效果。
A/B 競品對照:用自有業務樣本對比 Kimi K3($3/$15)、Qwen3.8-Max($2/$6)與 V4-Flash($0.14/$0.28)的延遲、成功率與單任務成本。
配置 Agent 宿主:Harness 尚未公開,生產環境可暫用 Claude Code / OpenCode 作爲執行框架;待 Harness GA 後複測 Terminal Bench 類任務表現。
建立主備路由與監控:高頻批量任務走 V4-Flash;複雜推理保留 V4-Pro 預覽版或 Claude 作爲 fallback;設置成本上限與高峯時段 2 倍加價預警。
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "分析這段代碼..."}]
)
純 API 調用可接入 V4-Flash 做大規模 Agent 推理,但 iOS 簽名鏈、Xcode 本地構建、Metal 推理與 7×24 Agent 長跑仍依賴實體 macOS 節點——筆記本難以穩定常駐 OpenClaw / Claude Code 宿主,虛擬機則有性能損耗與 EULA 風險。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化的生產環境,VpsMesh 的 Mac Mini 雲端租賃通常是更優解:實體 Apple Silicon、root 權限與可預測月租,可與 DeepSeek API 形成「雲端推理 + 本地構建」互補架構。本地推理方案另見 ds4 + V4 Flash 本地推理指南。
參考資料:DeepSeek 官方 API 文檔與 changelog · 技術報告 · Artificial Analysis · 21 世紀經濟報道 · 快科技 · V2EX 社區討論。發佈前請以官方最新定價、跑分及 V4-Pro/Harness 上線狀態爲準。
原生支持 100 萬 token 上下文,且長上下文場景下計算與顯存開銷大幅降低(官方數據:V4-Pro 在百萬 token 下 FLOPs 僅爲 V3.2 的 27%,KV Cache 僅爲 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。
普通對話、批量處理或大規模低成本 Agent 流水線,V4-Flash-0731 性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。更深世界知識或複雜推理、預算不敏感時,可先用 V4-Pro 預覽版,等官方版上線後再評估。
截至 2026 年 8 月 5 日還不能。目前上線的官方版只有 V4-Flash-0731,且僅限 API。V4-Pro 官方版和 Harness 官方口徑是「儘快發佈」,網上流傳的 8 月 10–20 日等具體時間是未經證實的傳言。部署 Agent 宿主可參考 Mac Mini M4 租賃定價。
建議區分對待。SWE-bench Verified 等被廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分基於未公開的 Harness 測得,官方也提示對框架選擇高度敏感——建議等社區用 Claude Code、Cursor 等獨立復現後再下結論。
若用 OpenAI / Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向新官方版本。若仍用已停用的 deepseek-chat / deepseek-reasoner,需儘快切換。更多部署細節見 幫助中心。