峰谷料金 · 100万token · SWE-bench 80.6% · 7/24までに移行
3か月間のプレビュー期間を経て、DeepSeek V4は2026年7月20日に一般提供(GA)正式版として公開されました。DeepSeek V4はGPT-5.6より優れているか、本番でまだdeepseek-chatを呼び出しているか——そんな開発者向けに、本稿では完全タイムライン、V4-Pro/Flashアーキテクチャ、ベンチマーク表、峰谷料金、Claude Fable 5との正直な比較、7月24日締切の6ステップ移行Runbookをまとめます。GA版ではAgent/数学/コード性能の向上に加え時間帯別料金が導入され、SWE-bench Verifiedは80.6%(オープンウェイト最高)を記録、オフピーク出力は$0.87/M tokenです。データ基準日:2026-07-20
プレビューは2026年4月24日に公開されました。本日のGAは新アーキテクチャではなく、プレビューを本番向けの安定性・最適化・商用料金体系へ昇格させたものです。
| 日付 | マイルストーン |
|---|---|
| 2026-04-24 | プレビュー + MITオープンソース:V4-Pro(1.6T)とV4-Flash(284B) |
| 2026-05 | 本番向けチューニング版、API一般提供開始 |
| 2026-06 | V4-Pro出力料金を75%永久値下げ($0.87/M token) |
| 2026-06-29 | 全APIユーザーへメール:7月中旬GA + 峰谷料金の初回開示 |
| 2026-07-19 | グレーリリーステスター、メディアが本格ローンチを報道 |
| 2026-07-20 | GA正式版が全世界で稼働開始 |
| 2026-07-24 | deepseek-chatとdeepseek-reasonerが永久停止(15:59 UTC) |
開発者が今直面している5つの課題は次のとおりです。
レガシーエンドポイントが4日後に停止:deepseek-chatとdeepseek-reasonerは7月24日以降動作しません。
峰谷料金の複雑さ:平日の業務時間帯は料金が2倍になるため、24時間パイプラインにはスケジューリングが必要です。
クローズドモデルのコスト:Claude Fable 5は出力約$50/M、GPT-5.6 Solは約$15/Mで、大規模利用時に予算を圧迫します。
100万tokenは紙の上だけ:多くのモデルは長コンテキストでKVキャッシュメモリがボトルネックになります。
データ主権:クローズドAPIはコンプライアンス要件の厳しいワークロード向けにセルフホストできません。
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6兆 | 2840億 |
| トークンあたり活性化 | 490億(3%) | 130億(4.6%) |
| レイヤー数 | 61 | 43 |
| コンテキストウィンドウ | 1,000,000 token | 1,000,000 token |
| 最大出力 | 384K | 384K |
| 精度 | FP4(MoEエキスパート)+ FP8 | 同左 |
| 学習データ | 33T+ token | 32T+ token |
| ライセンス | MIT | MIT |
V4はV2/V3のMLAを廃止し、2トラック方式を採用しました。Compressed Sparse Attention(CSA)はSoftmaxゲート付きプーリングでKVを4倍圧縮し、FP4ライトニングインデクサー(Proはtop-1024、Flashはtop-512)と128 tokenスライディングウィンドウを組み合わせます。Heavily Compressed Attention(HCA)は128倍圧縮後に密なグローバルアテンションを実行します。レイヤーはCSAとHCAを交互に配置します。
100万token時:V4-Proの推論FLOPsはV3.2の27%、KVキャッシュメモリはV3.2の10%(Flashは7%)に削減されます。
Manifold-Constrained Hyper-Connections(mHC)は標準残差接続を4チャネルストリームに置き換え、双確率行列で61レイヤーを通じて勾配を安定化します。Muon(AdamWではなく)はNewton-Schulz直交化により、より高速で安定した学習を実現します。
| モード | 用途 |
|---|---|
| Non-think | 高速ルーティング、分類、シンプルなQ&A |
| Think High | デバッグ、中程度の複雑さ |
| Think Max | 複雑な数学、多段Agent(384K+コンテキスト) |
推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。
| ベンチマーク | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% オープン最高 | 96.0% | 非公開 | 約69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis Strategy & Ops指数:Fable 5は$3.48/taskで50点、V4-Proは$0.03/taskで38点——性能差24%に対し116倍安いコストです。V4-Flashは6カテゴリすべてで$0.04/task未満に収まります。
| 観点 | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープン / セルフホスト | 可(MIT) | 不可 | 不可 |
| 100万token | 可 | 未確認 | 可 |
| 最高難度コーディング | 第2 tier | 第2 tier | SWE-bench Pro首位 |
| アルゴリズム / 数学 | LiveCodeBench首位 | 強い | — |
| 出力(オフピーク) | $0.87/M | 約$15/M | 約$50/M |
| 出力(ピーク) | $1.74/M | — | — |
| データ主権 | セルフホスト可能 | 不可 | 不可 |
ピーク時間(北京時間):平日09:00–12:00および14:00–18:00——全料金が2倍になります。
| モデル | 項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | $0.0035/M | 2倍 |
| 入力(キャッシュミス) | $0.435/M | $0.87/M | |
| 出力 | $0.87/M | $1.74/M | |
| V4-Flash | 入力(キャッシュヒット) | $0.0028/M | 2倍 |
| 入力(キャッシュミス) | $0.14/M | $0.28/M | |
| 出力 | $0.28/M | $0.56/M |
ピーク時でもV4-Pro出力はClaude Opus 4.8($15/M)およびGPT-5.6 Sol(約$15/M)より8.6倍安いです。
コスト最適化のヒント:バッチジョブはオフピークにスケジュールし、プロンプトキャッシュヒット率を最大化し、単純クエリはV4-Flashへルーティングし、DeepSeekの料金変更メール(24時間前通知)を監視してください。
締切:2026年7月24日 15:59 UTC。レガシー名deepseek-chatとdeepseek-reasonerは永久に無効化されます。
| 旧名称 | 新しい相当モデル |
|---|---|
deepseek-chat | deepseek-v4-flash(非thinking) |
deepseek-reasoner | deepseek-v4-flash(thinking)またはdeepseek-v4-pro |
コードベースを検索:環境変数とCI設定を含めdeepseek-chatとdeepseek-reasonerをgrepします。
ターゲットモデルを選定:チャット/ルーティングはFlash、高度な推論はProを選びます。
OpenAI SDKを更新:modelのみ変更し、base_urlはhttps://api.deepseek.comのままです。
thinkingモードを有効化:extra_bodyのthinking設定でreasoner相当の挙動を再現します。
ステージングで検証:コアフローを確認し、Think Maxには384K+コンテキストが必要です。
締切前に本番反映:Anthropic SDK利用者もモデル名のみ差し替え、base URLは同一です。
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Solve step by step..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
GA正式版はすべてのベンチマークでClaude Fable 5を上回る必要はありません。クローズドフロンティアAPIの1/10から1/100のコストで、最強のオープンウェイトコーディングモデルを提供することが目的です。
V4のセルフホストや長コンテキストAgent運用には信頼性の高いハードウェアが必要です。ノートPCは24時間稼働に向かず、汎用VMは性能とコンプライアンスのリスクを増やします。本番iOS CI/CDとAI Agent自動化には、VpsMesh Mac Miniクラウドレンタルが通常より適した選択です。ベアメタルApple Siliconはds4 + V4 Flash on Macのようなローカル推論スタックと相性が良いです。
出典:DeepSeek公式ドキュメント、arXiv:2606.19348、HuggingFace、LLMReference、Artificial Analysis、MangoMind Blog、TechNode。
平日の北京時間09:00–12:00と14:00–18:00は全料金が2倍になります。V4-Proのオフピーク出力は$0.87/M token、ピークは$1.74/Mです。開発環境コストの参考としてMac Mini M4レンタル料金もご覧ください。
7月24日15:59 UTCまでにdeepseek-chatをdeepseek-v4-flashへ、deepseek-reasonerをFlashのthinkingモードまたはdeepseek-v4-proへ置き換えてください。base URLは変更ありません。
Proは1.6Tフラッグシップ(活性化49B)、Flashは284B(活性化13B)です。どちらも100万tokenに対応します。ルーティング向けはFlash(出力$0.28/M)、複雑なAgent向けはProを選びます。
最難関ベンチマークではFable 5とGPT-5.6が先行します。V4-ProはMITライセンスでセルフホスト可能であり、オフピーク出力$0.87/Mで2026年最安クラスのフロンティアAI APIの一つです。
V4-Flashはds4などのエンジンでハイエンドMac(統合メモリ96GB以上)上で動作可能です。Proフル版はクラスター級ハードウェアが必要です。セットアップ詳細はヘルプセンターをご参照ください。
Agent、数学、コード性能の向上、峰谷料金の導入、全世界GA提供、7月24日のレガシーモデル名廃止が主な変更点です。基盤MoEアーキテクチャは変更されていません。