DeepSeek V4 GA 正式版

峰谷料金 · 100万token · SWE-bench 80.6% · 7/24までに移行

DeepSeek V4 GA 正式版 料金 ベンチマーク アーキテクチャ 2026年7月

3か月間のプレビュー期間を経て、DeepSeek V4は2026年7月20日に一般提供(GA)正式版として公開されました。DeepSeek V4はGPT-5.6より優れているか、本番でまだdeepseek-chatを呼び出しているか——そんな開発者向けに、本稿では完全タイムライン、V4-Pro/Flashアーキテクチャ、ベンチマーク表、峰谷料金、Claude Fable 5との正直な比較、7月24日締切の6ステップ移行Runbookをまとめます。GA版ではAgent/数学/コード性能の向上に加え時間帯別料金が導入され、SWE-bench Verifiedは80.6%(オープンウェイト最高)を記録、オフピーク出力は$0.87/M tokenです。データ基準日:2026-07-20

01

GA正式版と4月プレビューの違い:DeepSeek V4 公開タイムライン

プレビューは2026年4月24日に公開されました。本日のGAは新アーキテクチャではなく、プレビューを本番向けの安定性・最適化・商用料金体系へ昇格させたものです。

日付マイルストーン
2026-04-24プレビュー + MITオープンソース:V4-Pro(1.6T)とV4-Flash(284B)
2026-05本番向けチューニング版、API一般提供開始
2026-06V4-Pro出力料金を75%永久値下げ($0.87/M token)
2026-06-29全APIユーザーへメール:7月中旬GA + 峰谷料金の初回開示
2026-07-19グレーリリーステスター、メディアが本格ローンチを報道
2026-07-20GA正式版が全世界で稼働開始
2026-07-24deepseek-chatdeepseek-reasonerが永久停止(15:59 UTC)

開発者が今直面している5つの課題は次のとおりです。

  1. 01

    レガシーエンドポイントが4日後に停止:deepseek-chatdeepseek-reasonerは7月24日以降動作しません。

  2. 02

    峰谷料金の複雑さ:平日の業務時間帯は料金が2倍になるため、24時間パイプラインにはスケジューリングが必要です。

  3. 03

    クローズドモデルのコスト:Claude Fable 5は出力約$50/M、GPT-5.6 Solは約$15/Mで、大規模利用時に予算を圧迫します。

  4. 04

    100万tokenは紙の上だけ:多くのモデルは長コンテキストでKVキャッシュメモリがボトルネックになります。

  5. 05

    データ主権:クローズドAPIはコンプライアンス要件の厳しいワークロード向けにセルフホストできません。

02

アーキテクチャ:CSA+HCAが100万tokenを実用化する仕組み

仕様V4-ProV4-Flash
総パラメータ数1.6兆2840億
トークンあたり活性化490億(3%)130億(4.6%)
レイヤー数6143
コンテキストウィンドウ1,000,000 token1,000,000 token
最大出力384K384K
精度FP4(MoEエキスパート)+ FP8同左
学習データ33T+ token32T+ token
ライセンスMITMIT

CSA + HCA ハイブリッドアテンション

V4はV2/V3のMLAを廃止し、2トラック方式を採用しました。Compressed Sparse Attention(CSA)はSoftmaxゲート付きプーリングでKVを4倍圧縮し、FP4ライトニングインデクサー(Proはtop-1024、Flashはtop-512)と128 tokenスライディングウィンドウを組み合わせます。Heavily Compressed Attention(HCA)は128倍圧縮後に密なグローバルアテンションを実行します。レイヤーはCSAとHCAを交互に配置します。

100万token時:V4-Proの推論FLOPsはV3.2の27%、KVキャッシュメモリはV3.2の10%(Flashは7%)に削減されます。

mHCとMuonオプティマイザ

Manifold-Constrained Hyper-Connections(mHC)は標準残差接続を4チャネルストリームに置き換え、双確率行列で61レイヤーを通じて勾配を安定化します。Muon(AdamWではなく)はNewton-Schulz直交化により、より高速で安定した学習を実現します。

3つの推論モード

モード用途
Non-think高速ルーティング、分類、シンプルなQ&A
Think Highデバッグ、中程度の複雑さ
Think Max複雑な数学、多段Agent(384K+コンテキスト)

推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。

03

ベンチマーク数値:V4が勝つ領域と負ける領域

ベンチマークV4-ProClaude Fable 5GPT-5.6 UltraOpus 4.8
SWE-bench Verified80.6% オープン最高96.0%非公開約69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

Artificial Analysis Strategy & Ops指数:Fable 5は$3.48/taskで50点、V4-Proは$0.03/taskで38点——性能差24%に対し116倍安いコストです。V4-Flashは6カテゴリすべてで$0.04/task未満に収まります。

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5:正直な比較

観点V4-ProGPT-5.6 SolClaude Fable 5
オープン / セルフホスト可(MIT)不可不可
100万token未確認
最高難度コーディング第2 tier第2 tierSWE-bench Pro首位
アルゴリズム / 数学LiveCodeBench首位強い
出力(オフピーク)$0.87/M約$15/M約$50/M
出力(ピーク)$1.74/M
データ主権セルフホスト可能不可不可

峰谷料金表

ピーク時間(北京時間):平日09:00–12:00および14:00–18:00——全料金が2倍になります。

モデル項目オフピークピーク
V4-Pro入力(キャッシュヒット)$0.0035/M2倍
入力(キャッシュミス)$0.435/M$0.87/M
出力$0.87/M$1.74/M
V4-Flash入力(キャッシュヒット)$0.0028/M2倍
入力(キャッシュミス)$0.14/M$0.28/M
出力$0.28/M$0.56/M

ピーク時でもV4-Pro出力はClaude Opus 4.8($15/M)およびGPT-5.6 Sol(約$15/M)より8.6倍安いです。

コスト最適化のヒント:バッチジョブはオフピークにスケジュールし、プロンプトキャッシュヒット率を最大化し、単純クエリはV4-Flashへルーティングし、DeepSeekの料金変更メール(24時間前通知)を監視してください。

05

移行Runbook:7月24日までの6ステップ

締切:2026年7月24日 15:59 UTC。レガシー名deepseek-chatdeepseek-reasonerは永久に無効化されます。

旧名称新しい相当モデル
deepseek-chatdeepseek-v4-flash(非thinking)
deepseek-reasonerdeepseek-v4-flash(thinking)またはdeepseek-v4-pro
  1. 01

    コードベースを検索:環境変数とCI設定を含めdeepseek-chatdeepseek-reasonerをgrepします。

  2. 02

    ターゲットモデルを選定:チャット/ルーティングはFlash、高度な推論はProを選びます。

  3. 03

    OpenAI SDKを更新:modelのみ変更し、base_urlhttps://api.deepseek.comのままです。

  4. 04

    thinkingモードを有効化:extra_bodythinking設定でreasoner相当の挙動を再現します。

  5. 05

    ステージングで検証:コアフローを確認し、Think Maxには384K+コンテキストが必要です。

  6. 06

    締切前に本番反映:Anthropic SDK利用者もモデル名のみ差し替え、base URLは同一です。

python
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Solve step by step..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

引用に値するハード数値

  • SWE-bench Verified:80.6%——オープンウェイト最高スコア
  • KVキャッシュ:100万token時にV3.2メモリの10%
  • コスト比:Fable 5比で$0.03 vs $3.48/task
  • ピーク出力:$1.74/M——クローズドフロンティアAPIより依然8.6倍安い
  • 移行締切:2026年7月24日 15:59 UTC

GA正式版はすべてのベンチマークでClaude Fable 5を上回る必要はありません。クローズドフロンティアAPIの1/10から1/100のコストで、最強のオープンウェイトコーディングモデルを提供することが目的です。

V4のセルフホストや長コンテキストAgent運用には信頼性の高いハードウェアが必要です。ノートPCは24時間稼働に向かず、汎用VMは性能とコンプライアンスのリスクを増やします。本番iOS CI/CDとAI Agent自動化には、VpsMesh Mac Miniクラウドレンタルが通常より適した選択です。ベアメタルApple Siliconはds4 + V4 Flash on Macのようなローカル推論スタックと相性が良いです。

出典:DeepSeek公式ドキュメント、arXiv:2606.19348、HuggingFace、LLMReference、Artificial Analysis、MangoMind Blog、TechNode。

FAQ

よくある質問

平日の北京時間09:00–12:00と14:00–18:00は全料金が2倍になります。V4-Proのオフピーク出力は$0.87/M token、ピークは$1.74/Mです。開発環境コストの参考としてMac Mini M4レンタル料金もご覧ください。

7月24日15:59 UTCまでにdeepseek-chatdeepseek-v4-flashへ、deepseek-reasonerをFlashのthinkingモードまたはdeepseek-v4-proへ置き換えてください。base URLは変更ありません。

Proは1.6Tフラッグシップ(活性化49B)、Flashは284B(活性化13B)です。どちらも100万tokenに対応します。ルーティング向けはFlash(出力$0.28/M)、複雑なAgent向けはProを選びます。

最難関ベンチマークではFable 5とGPT-5.6が先行します。V4-ProはMITライセンスでセルフホスト可能であり、オフピーク出力$0.87/Mで2026年最安クラスのフロンティアAI APIの一つです。

V4-Flashはds4などのエンジンでハイエンドMac(統合メモリ96GB以上)上で動作可能です。Proフル版はクラスター級ハードウェアが必要です。セットアップ詳細はヘルプセンターをご参照ください。

Agent、数学、コード性能の向上、峰谷料金の導入、全世界GA提供、7月24日のレガシーモデル名廃止が主な変更点です。基盤MoEアーキテクチャは変更されていません。