Claude Opus 5が半額でFable 5に迫る
Kimi K3が「Claude自称」蒸留疑惑に

Opus 5 リリース · Fable 5 コスパ比較 · ホワイトハウス疑惑 · K3 本人確認テスト · 6ステップ Runbook

Claude Opus 5 リリースと Kimi K3 蒸留疑惑

今週の大型モデルリリースを追う開発者と技術意思決定者は、見かけ上無関係な 2 つのニュースに同じ問いを突きつけられます。7 月 24 日 Anthropic が Claude Opus 5 を公開し Claude Max 既定モデルに据えたこと。7 月 16 日 Moonshot AI が公開した Kimi K3 がホワイトハウスから「産業級蒸留」と公に非難され、独立研究者 Ryan Greenblatt が K3 がClaude 自称し内部デプロイ ID を出力する事象を報告したことです。本稿では Opus 5 vs Fable 5 比較表蒸留争点のタイムラインGreenblatt 技術証拠の読み方6 ステップ Runbook を整理し、Kimi K3 徹底レビューOpenRouter マルチモデル接続ガイドと相互リンクします。

01

今週の AI 二大事件:開発者が陥りやすい 5 つの選定盲点

Anthropic は Opus 5 で「フラッグシップが高すぎる」という市場圧力に応え、Moonshot AI は K3 の 2.8T パラメータと低価格でオープンソース路線を揺さぶります。情報過多の 72 時間のうちに、チームは次の 5 点で誤判断しやすくなります。

  1. 01

    「ニュース公開」を「検証済み能力」と混同する:K3 の完全ウェイトは 7 月 27 日公開予定で、争点が表面化した時点では外部からベンチマークを再現できません。Opus 5 は公式ベンチマークがありますが、あなたの workload は CursorBench と大きく異なる可能性があります。

  2. 02

    token 単価とタスク総コストを混同する:Opus 5 と Opus 4.8 の単価は同じですが、Thinking が既定 ON で effort 段階が出力長に影響します。Fable 5 は約 2 倍の単価ですが、max effort ピークは 0.5% 上回ります。

  3. 03

    コンプライアンスとデータ保持条項を軽視する:Fable 5 / Mythos 5 は 30 日間のデータ保持に同意する必要があります。Opus 5 は歴代 Opus と同様、デフォルトアクセスで強制保持なしです。企業シーンではベンチマークより硬い選定条件になり得ます。

  4. 04

    政治的非難を技術結論と同一視する:ホワイトハウス OSTP 長官 Michael Kratsios の「産業級蒸留」非難には公開証拠が付いていません。独立研究者は Fable 5 公開からわずか2 週間で深度蒸留が完了したとは考えにくいと指摘しています。

  5. 05

    「本人確認」の間接シグナルを無視する:Ryan Greenblatt の統計では K3 が Claude 自称し claude-opus-4-5-20250929 などの内部 ID を出力します。見出しより技術的価値が高い一方、蒸留確定とは言えません。

02

Claude Opus 5 リリース:Opus 5 と Fable 5 はどちらを選ぶべきか

2026 年 7 月 24 日、Anthropic は Claude Opus 5(モデル ID:claude-opus-5)を正式公開し、Claude Max 既定モデルに設定しました。Claude Pro ユーザーが利用できる最強 Opus 版でもあります。価格は Opus 4.8 と同一で、入力 $5 / 出力 $25(100 万 token あたり)です。コンテキスト 100 万 token(単一段階)、最大出力 128K、Thinking は既定 ON です。

公式ベンチマークの要点

  • Frontier-Bench v0.1:ソフトウェアエンジニアリングで全モデル最高、Opus 4.8 の2 倍以上、単タスクコストはより低い。
  • CursorBench 3.2:max effort で Fable 5 ピークとの差はわずか 0.5%、コストは Fable 5 の約半分。high / xhigh / max 各段階で市場最高のコスパ。
  • ARC-AGI 3:新規問題解決で次点モデルの3 倍
  • OSWorld 2.0:Fable 5 最高スコアの 3 分の 1 未満のコストで上回る。
  • Zapier AutomationBench:エンドツーエンド業務自動化で次点の約 1.5 倍、あるワークフローは100% 通過(従来未達成)。

「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor チーム

Claude Opus 5 vs Fable 5 選定比較

次元Claude Opus 5Claude Fable 5
入出力単価$5 / $25(100 万 token)約 $10 / $50(Opus 5 の約 2 倍)
CursorBench 3.2(max)Fable 5 ピークとの差 0.5%現行コーディング / agent ピーク基準
データ保持デフォルトアクセスで強制保持なし30 日間データ保持ポリシーへの同意が必要
サイバーセキュリティ分類器は Fable 5 より約 85% 緩く、ソースレベル脆弱性探索が可能より頻繁にブロック。デュアルユース最前線は Mythos 5
製品ポジションClaude Max 既定 / Pro 最強 Opusフラッグシップ価格、7 月 1 日から一般利用可
適用シーン日常主力、コンプライアンス重視、コスパ重視の本番 workload絶対ピークが必要で、保持と高単価を許容できるタスク

Box 企業顧客の実測では、データ分析ワークフローが 11%、デューデリジェンスが 17%、全体精度が 8% 向上しました。生命科学では、スペクトルから分子構造を推定する内部テストで Opus 4.8 比 10.2 ポイント、タンパク質配列変異の機能予測で 7.7 ポイント 上回りました。

アライメントと安全:Opus 5 は Anthropic 史上最も整列度が高いモデルです。欺瞞行動は最少で、悪用誘導にも最も抵抗します。一方、攻撃的サイバーセキュリティや生物安全などデュアルユース分野では、Anthropic は意図的に Opus 5 で最前線を更新せず、制限付き Mythos 5 がその位置を占めています。

03

Kimi K3 蒸留疑惑:ホワイトハウス非難、タイムライン疑義、K3 の Claude 自称

Opus 5 が「通常の新製品リリース」なら、Kimi K3 の展開ははるかに複雑です。Moonshot AI は 7 月 16 日に K3 を公開し、総パラメータ 2.8 兆と称しました。3T 級に入る初のオープンウェイトモデルです。896 エキスパート MoE(token あたり 16 活性、実効約 500 億)、100 万 token コンテキスト、ネイティブ視覚理解、Kimi Delta Attention(KDA)アーキテクチャを採用しています。

Kimi K3 規模とベンチマーク(公式発表)

ベンチマークKimi K3 スコア備考
GPQA-Diamond93.5%公開時点オープンソース最高
BrowseComp91.2%公開時点最高
Terminal-Bench 2.188.3%GPT-5.6 Sol より 0.5 ポイント低い
SWE Marathon42.0%総合ベスト
完全ウェイト公開7 月 27 日予定執筆時点では外部独立検証不可

ホワイトハウス非難:何が起きたのか

2026 年 7 月 22〜23 日、ホワイトハウス OSTP 長官 Michael Kratsios が X で、Moonshot AI が「大規模かつ隠蔽的な産業級蒸留」で Anthropic Fable モデルの能力を窃取したと非難しました。輸出許可のない Nvidia GB300 チップ(タイ経由サーバー迂回の疑い)にも言及しました。財務長官 Scott Bessent も「多くの中国モデルで米国大モデルのウォーターマークを発見した」と付和しましたが、具体的内容は示していません。

これは初めてではありません。2026 年 2 月、Anthropic は Moonshot AI、DeepSeek、MiniMax による「産業級蒸留攻撃」を公に非難し、Moonshot AI に340 万回超の異常 API 相互作用を特定したと述べました。「明らかに通常利用から逸脱するパターン」であり、リクエストメタデータから一部行為が同社幹部に関連すると主張しました。Moonshot AI は正面から肯定も否定もしていません。

タイムラインへの疑義:TechCrunch が取材した複数の研究者は、Fable 5 が 7 月 1 日に一般公開されてから K3 公開(7 月 16 日)まで2 週間しかなく、「十分なデータ蒸留、学習、公開を 2 週間で完了するのは非現実的」と指摘しています。Snorkel AI 共同創業者 Braden Hancock は「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation.」と述べました。Allen Institute の Nathan Lambert も、中国モデルが最前線に迫る中、単純蒸留の限界効用は小さくなり、差を広げるのは強化学習だと指摘しています。

Kimi K3 は Claude のコピーか:最も硬い技術シグナル

Redwood Research 首席科学者 Ryan Greenblatt(7 月 24 日前後、GitHub:rgreenblatt/which_claude_is_k3)は複数モデルの自己紹介行動を交差エントロピーで比較し、次を報告しました。

  • Kimi K3 は「あなたは誰ですか」と聞かれると、異常に高頻度で Claude 自称し、claude-opus-4-5-20250929claude-sonnet-4-5-20250929 など Claude 公式内部デプロイ ID まで出力する。
  • 本物の Claude Sonnet 4.5 は「Claude Sonnet 4.5 です」と答える。Opus 4.5 すらこの種の内部版番号を正確に述べない。
  • K3 の自称バージョンは「Claude 4.5 世代」(2025 年末)に固定され、現行 Fable/Mythos ではない。前世代 K2 はより古い Claude Sonnet 4 を指す傾向があり、「世代を追う」パターンが見える。
出力例
質問:あなたは誰ですか?
Kimi K3(異常に高頻度):私は Claude です。バージョン claude-opus-4-5-20250929
本物 Claude Opus 4.5:私は Claude です。通常は上記内部デプロイ ID を述べない

Greenblatt の解釈では、モデルが「教師モデル」のデプロイメタデータを、教師自身より正確に語るのは「会話スタイルの模倣」では説明しにくく、デプロイメタデータ付き Claude データ(API ログやラベル付き合成データなど)が学習に混入した可能性が高いと述べています。ただし、これだけで蒸留成立とは言えないとも強調しています。データ汚染やシステムプロンプト漏洩でも起こり得ます。

コミュニティでは、オープンソースとクローズドの差が「月」ではなく「日」単位で縮む歓喜、2.8T でローカル実行はほぼ不可能という現実論、K3 の真の売りは低価格と拒否の少なさだという実務論が並存しています。K3 アーキテクチャの詳細はKimi K3 徹底レビューをご覧ください。

04

6 ステップ Runbook:今週 Claude Opus 5 / Kimi K3 をどう選ぶか

2 つのニュースを同じ意思決定表に載せ、見出しに流されないための 6 ステップです。チームレビューでそのまま使えます。

  1. 01

    コンプライアンス境界を先に決める:30 日データ保持を許容できない、またはサプライチェーン / geo リスクを避けたい workload では Opus 5(強制保持なし)を優先し、Fable 5 より前に評価します。K3 を検討する場合は、オープンウェイトライセンスと provenance 争点を別途評価してください。

  2. 02

    単価ではなくタスク総コストを計算する:自社 golden prompt セットで Opus 5 と Fable 5 の token 消費と pass rate を測定します。CursorBench の 0.5% 差は、あなたのシーンでは effort 段階で拡大または縮小します。

  3. 03

    「API 利用可」と「ウェイト検証可」を分ける:K3 API は稼働中ですが完全ウェイトは 7 月 27 日まで。公開前はアーキテクチャ声明とスコアを第三者が完全再現できません。

  4. 04

    蒸留非難を 3 層で理解する:政治層(ホワイトハウス / Kratsios)→ タイムライン層(TechCrunch 専門家)→ 技術層(Greenblatt 本人確認統計)。証拠強度は異なり、混同しないでください。

  5. 05

    ゲートウェイ統一で切替コストを下げる:Claude とオープンソース候補を並行試すなら、OpenRouter 統合ゲートウェイで fallback チェーンを組み、ベンダーごとの SDK と Key ローテーションを分離しない運用にしてください。

  6. 06

    7 月 27 日以降に K3 を再評価する:ウェイト公開が今回争点の分岐点です。その後、独立研究者がパラメータ規模、アーキテクチャ、ベンチマーク再現を検証できます。「本番採用可否」の判断は少なくともこの日付以降に延期することを推奨します。

イベントタイムライン早見表

日付出来事
2026-02Anthropic が Moonshot AI / DeepSeek / MiniMax の産業級蒸留を初公開非難
2026-07-01Claude Fable 5 が一般向けに正式利用可能に
2026-07-16Kimi K3 API / 製品公開(2.8T パラメータ)
2026-07-22/23ホワイトハウス OSTP 長官 Kratsios が蒸留 + 違法チップを公非難
2026-07-24Claude Opus 5 公開。Greenblatt が K3 本人確認統計を公開
2026-07-27(予定)Kimi K3 完全ウェイト公開
05

引用可能な硬データ:今はコスパが主戦場

2 件を並べると、トレンドは明確です。Opus 5 は「半額でフラッグシップに迫る」ことで市場のコスパ要求に応え、Kimi K3 は「オープン + 低価格 + 拒否の少なさ」で攻めます。K3 を巡る争点は、業界が問う低価格は技術最適化の成果か、他社モデルの無断利用かという点に集約されます。

  • Opus 5 / Fable 5 コスト比:同ベンチマーク段階で Opus 5 単価は Fable 5 の約半分、CursorBench max 差は 0.5%。
  • K3 規模:2.8T 総パラメータ、896 エキスパート MoE、100 万 token コンテキスト。GPQA-Diamond 93.5%、BrowseComp 91.2%。
  • 蒸留間接証拠:K3 の Claude 4.5 世代内部 ID 自称。Anthropic 2 月非難の 340 万回超異常 API 相互作用。いずれも決定証明ではないが、現時点で最も整理された証拠連鎖です。

Agent や CI パイプラインで7×24 の安定 Claude API 呼び出し、長時間ベンチマーク、マルチモデル A/Bが必要な場合、Gateway と Runner をスリープするローカルノートに置くと、ネット断、プロセス kill、DerivedData と秘密鍵の分散など、token コストを上回る運用負荷が出やすくなります。iOS CI/CD と AI Agent 自動化の本番環境では、VpsMesh の Mac Mini クラウドレンタルが通常はより適した選択です。物理 Apple Silicon ノードをプロジェクト期間に応じて弹性レンタルでき、Agent とビルドタスクを個人端末のオンライン状態に依存させません。詳細はMac Mini M4 レンタル料金をご確認ください。

FAQ

よくある質問

Opus 5 は入力 $5 / 出力 $25(100 万 token あたり)で、Fable 5($10/$50 程度)の約半分です。CursorBench 3.2 max effort では Fable 5 ピークとの差は 1% 未満です。日常の coding / agent タスクなら Opus 5 がコスパ面で有利です。Agent ベンチマークの実行環境はヘルプセンターのリモート Mac 設定を参照してください。

はい。2026 年 7 月 24 日リリース当日から Opus 5 が Claude Max の既定モデルになり、Claude Pro ユーザーが利用できる最強 Opus 版です。Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry から利用でき、モデル ID は claude-opus-5 です。

執筆時点では争点のまま、最終的には証明されていません。ホワイトハウス非難には公開証拠がありません。独立研究者は 2 週間での深度蒸留は非現実的と指摘します。Ryan Greenblatt が発見した「K3 が Claude 自称し内部版番号を出力する」事象が現時点で最も技術的な間接証拠ですが、蒸留成立の決定打にはなりません。

公式は 2026 年 7 月 27 日の完全ウェイト公開を約束しています。執筆時点では外部研究者が K3 のアーキテクチャ詳細とベンチマーク再現を完全に独立検証できず、これが議論が続く要因の一つです。

Redwood Research の Ryan Greenblatt の統計分析では、K3 が自己紹介で異常に高頻度で Claude 自称し、claude-opus-4-5-20250929 など Anthropic 内部デプロイ ID まで出力します。本物 Claude より正確に述べる点が特徴的です。デプロイメタデータ付き Claude データの混入が最も plausible な説明ですが、Greenblatt はこれ単独では蒸留成立の決定証明にならないと強調しています。