DeepSeek V4 Flash 正式版评测

0731 后训练升级 · Harness 框架 · 竞品横比 · 跑分争议 · Pro 版何时上线

DeepSeek V4 Flash 正式版大模型评测与 API 定价对比

2026 年 7 月 31 日,DeepSeekV4-Flash-0731 升级为官方正式版:参数规模不变(284B / 13B 激活),仅靠后训练就在多项 Agent 基准上反超自家更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。若你正纠结「跑分是否可信」「与 Kimi K3Qwen3.8-Max 如何选型」,或需迁移已停用的 deepseek-chat,本文将用时间线、核心定价表、Harness 拆解、横向对比、六步 Runbook 与跑分争议标注给出可执行结论。数据截止:2026-08-05

01

从 4 月预览到 7 月「官方版」:三个月时间线

这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。

  1. 01

    2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T / 49B 激活)与 V4-Flash(284B / 13B 激活),均支持 100 万 token 上下文,MIT 协议。详见 V4 满血版 GA 解读

  2. 02

    7 月 24 日:旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。

  3. 03

    7 月 27 日:月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。详见 Kimi K3 全面开源解读

  4. 04

    7 月 31 日:V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架 Harness,称即将随 V4 正式版发布。仅限 API,App 和网页端暂未同步。

  5. 05

    8 月 2 日:阿里 Qwen3.8-Max API GA,权重待放出。详见 Qwen3.8-Max 发布解读

  6. 06

    截至 8 月 5 日:V4-Pro 官方版仍是「尽快发布」。有媒体援引未署名消息源称 8 月 10–20 日 GA——未经 DeepSeek 官方证实,仅供参考

跟进此类发布时,常见五重盲区:

  1. 01

    误读「正式版」:架构与参数与 4 月预览版完全相同,性能提升完全来自后训练。

  2. 02

    跑分框架依赖:Agent 类跑分全部基于尚未公开的 Harness「极简模式」测得。

  3. 03

    API-only 限制:消费者 App / 网页聊天尚未更新到 0731 版本。

  4. 04

    Pro 版空窗:旗舰 V4-Pro 官方版仍未上线,复杂推理任务需继续用预览版。

  5. 05

    融资传闻:约 74 亿美元融资、487 亿美元估值等报道均来自财经媒体「消息人士」,尚无官方或监管备案确认。

02

核心数据一览:定价、参数与协议

模型状态总/激活参数上下文输入(未命中/命中,$/M)输出($/M)协议
DeepSeek-V4-Flash-0731官方正式版(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro预览版(4/24,官方版未发布)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3权重开源(7/27)2.8T / ~104B(社区估算)~1.05M$3.00 / $0.30$15.00Kimi K3 License
GLM-5.2开源(2026 年 6 月)~744B / ~40B1M未核实未核实MIT
Qwen3.8-MaxAPI GA(8/2),权重待放出2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00承诺开源

以上定价均为厂商公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。对比 Claude Opus 4.8:缓存未命中输入约便宜 36 倍,缓存命中约 179 倍,输出约 89 倍(据 21 世纪经济报道转引官方定价)。

03

后训练升级与 Harness:性能是怎么「变出来」的

架构没有变,变的是后训练

V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,官方明确说明性能提升「完全来自重新进行的后训练」。284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——印证 2026 年下半年大模型竞争中,后训练质量的重要性正在逼近甚至超过单纯堆参数。

混合注意力:CSA + HCA、mHC、Muon 优化器

根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架构三处关键改动:

  1. 01

    混合注意力(DSA):结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),降低长上下文计算与显存开销。

  2. 02

    流形约束超连接(mHC):对传统残差连接结构做了改进。

  3. 03

    Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。

官方指标:100 万 token 上下文下,V4-Pro 相比 V3.2 单 token 推理 FLOPs 仅为 27%,KV Cache 占用仅为 10%——尚未看到独立第三方复现验证。

Harness:DeepSeek 自研 Agent 框架首次亮相

7 月 31 日 changelog 首次出现 DeepSeek Harness——自研 Agent 执行框架,用于读写文件、调用工具、执行命令,对标 Claude Code。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方工具。官方 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部用 Harness「极简模式」测出,官方亦提示:「跑分对 harness 选择非常敏感,不能简单等同于模型本身能力的提升。」

04

横向对比与跑分争议:中国开源大模型「六边形混战」

模型实验室Intelligence Index(Artificial Analysis)单任务平均成本DeepSeek 官方 Agent 跑分
V4-Flash-0731DeepSeek50$0.03Terminal Bench 2.0:82.7(Harness 极简模式)
Kimi K3月之暗面57$0.86
GLM-5.2智谱比 V4-Flash 高约 1 分未核实
GPT-5.6 SolOpenAI高 9+ 分$1.86闭源
Claude Fable 5Anthropic高 9+ 分$3.15闭源

DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——单任务成本仅为 Kimi K3 的约 1/29、Claude Fable 5 的约 1/105。

跑分水分需标注:① Terminal Bench 2.0 的 82.7 分(vs V4-Pro 预览版 67.9)基于未公开的 Harness 极简模式,参数 max 档、top_p=0.95、temperature=1.0;② 海外开发者反馈输入缓存命中率偏低、安全分类器偶发超时;③ V4-Pro / Harness 上线日期仅为媒体传言;④ 融资/IPO 报道均未经官方证实。

05

六步 API 选型 Runbook:从迁移到生产路由

V4-Flash-0731 已兼容 OpenAI / Anthropic 格式 API,可直接接入 Claude Code、OpenCode、Cursor 等 Agent 工具链。以下为从零评估到生产的六步 Runbook:

  1. 01

    审计存量调用:排查代码中是否仍使用已停用的 deepseek-chat / deepseek-reasoner,统计月调用量与缓存命中率基线。

  2. 02

    切换模型命名:deepseek-chat 改为 deepseek-v4-flash(非 thinking);deepseek-reasoner 改为 Flash thinking 模式或 deepseek-v4-pro 预览版。base URL 无需变更。

  3. 03

    评估缓存策略:关注输入缓存命中率——海外社区反馈正式版缓存命中率偏低,直接影响账单;长上下文任务优先测试 Prompt Caching 效果。

  4. 04

    A/B 竞品对照:用自有业务样本对比 Kimi K3($3/$15)、Qwen3.8-Max($2/$6)与 V4-Flash($0.14/$0.28)的延迟、成功率与单任务成本。

  5. 05

    配置 Agent 宿主:Harness 尚未公开,生产环境可暂用 Claude Code / OpenCode 作为执行框架;待 Harness GA 后复测 Terminal Bench 类任务表现。

  6. 06

    建立主备路由与监控:高频批量任务走 V4-Flash;复杂推理保留 V4-Pro 预览版或 Claude 作为 fallback;设置成本上限与高峰时段 2 倍加价预警。

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "分析这段代码..."}]
)
06

行业背景、硬核数据与选型收束

  • 「斩杀线」效应:中文开发者社区流传的说法——DeepSeek 以「够用性能 + 极端低价」给同行设下门槛;这也解释了 GPT-5.6 Luna 一次性降价 80% 等密集调价动作。
  • 社区情绪反转:Pro 版迟迟未兑现时,梁文锋被戏称「梁白开」;Flash 0731 超预期后又称「梁圣」——观察中国 AI 社区情绪的有趣侧面。
  • 算力股反应钝化:7 月 31 日英伟达、博通、AMD 未明显波动——市场已习惯「DeepSeek 式效率突破」,与 2025 年初 R1 引发芯片股大跌形成对比。
  • OpenRouter 调用量:V4-Flash 预览版曾连续七周稳坐 OpenRouter 调用量第一,印证「大规模低成本 Agent 调用」才是其核心用户群。
  • Terminal Bench 2.0:官方报 82.7 分 vs V4-Pro 预览版 67.9——但测试框架为未公开 Harness,独立复现前应视为厂商自报。

纯 API 调用可接入 V4-Flash 做大规模 Agent 推理,但 iOS 签名链、Xcode 本地构建、Metal 推理与 7×24 Agent 长跑仍依赖实体 macOS 节点——笔记本难以稳定常驻 OpenClaw / Claude Code 宿主,虚拟机则有性能损耗与 EULA 风险。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化的生产环境,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon、root 权限与可预测月租,可与 DeepSeek API 形成「云端推理 + 本地构建」互补架构。本地推理方案另见 ds4 + V4 Flash 本地推理指南

参考资料:DeepSeek 官方 API 文档与 changelog · 技术报告 · Artificial Analysis · 21 世纪经济报道 · 快科技 · V2EX 社区讨论。发布前请以官方最新定价、跑分及 V4-Pro/Harness 上线状态为准。

FAQ

常见问题

原生支持 100 万 token 上下文,且长上下文场景下计算与显存开销大幅降低(官方数据:V4-Pro 在百万 token 下 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配 Claude Code、OpenCode 等主流 Agent 工具。

普通对话、批量处理或大规模低成本 Agent 流水线,V4-Flash-0731 性价比更高,且 Agent 跑分已反超 V4-Pro 预览版。更深世界知识或复杂推理、预算不敏感时,可先用 V4-Pro 预览版,等官方版上线后再评估。

截至 2026 年 8 月 5 日还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API。V4-Pro 官方版和 Harness 官方口径是「尽快发布」,网上流传的 8 月 10–20 日等具体时间是未经证实的传言。部署 Agent 宿主可参考 Mac Mini M4 租赁定价

建议区分对待。SWE-bench Verified 等被广泛采用的第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分基于未公开的 Harness 测得,官方也提示对框架选择高度敏感——建议等社区用 Claude Code、Cursor 等独立复现后再下结论。

若用 OpenAI / Anthropic 格式 API 接入 DeepSeek,无需改代码,deepseek-v4-flash 会自动指向新官方版本。若仍用已停用的 deepseek-chat / deepseek-reasoner,需尽快切换。更多部署细节见 帮助中心