Claude Opus 5 價格減半逼近旗艦
Kimi K3 卻陷「自稱 Claude」蒸餾門

Opus 5 發布 · Fable 5 性價比對比 · 白宮指控 · K3 身份混淆技術證據 · 六步選型 Runbook

Claude Opus 5 發布與 Kimi K3 蒸餾門爭議

正在跟進本週大模型發布的開發者與技術決策者同時面對兩條看似無關、實則都指向「性價比與能力來源」的線索:7 月 24 日 Anthropic 發布 Claude Opus 5 並設為 Claude Max 預設模型;7 月 16 日月之暗面發布的 Kimi K3 則遭白宮公開指控「工業級蒸餾」,獨立研究者還發現 K3 會自稱是 Claude 並吐出內部部署 ID。本文給出 Opus 5 vs Fable 5 對比表蒸餾爭議完整時間線Greenblatt 技術證據解讀六步 Runbook,並與Kimi K3 深度評測OpenRouter 多模型接入教程互鏈。

01

本週 AI 圈兩大事件:開發者常見的五類選型盲區

Anthropic 用 Opus 5 回應「旗艦太貴」的市場壓力;Moonshot 用 K3 的 2.8T 引數與低價衝擊開源賽道。但在資訊過載的 72 小時視窗裡,團隊很容易在以下五個環節做出誤判。

  1. 01

    把「新聞發布」當「可驗證能力」:K3 完整權重承諾 7 月 27 日才放出,爭議爆發時外部無法復現基準;Opus 5 雖已有官方 benchmark,但你的 workload 可能與 CursorBench 差異很大。

  2. 02

    混淆 token 單價與任務總成本:Opus 5 與 Opus 4.8 單價相同,但 Thinking 預設開啟、effort 檔位影響輸出長度;Fable 5 雖貴一倍,max effort 峰值仍高 0.5%。

  3. 03

    忽視合規與資料留存條款:Fable 5 / Mythos 5 需接受 30 天資料留存;Opus 5 延續歷代 Opus「預設不強制留存」——對企業場景可能是比 benchmark 更硬的篩選條件。

  4. 04

    把政治指控當技術結論:白宮 OSTP 主任 Kratsios 的「工業級蒸餾」指控未附公開證據;獨立研究者從兩週時間線角度普遍質疑「Fable 5 公開僅 15 天即完成深度蒸餾」的可行性。

  5. 05

    忽略「身份混淆」這一間接信號:Ryan Greenblatt 的統計顯示 K3 自稱 Claude 並吐出 claude-opus-4-5-20250929 等內部 ID——這比新聞標題更有技術含金量,但也不能直接等同「蒸餾已證實」。

02

Claude Opus 5 發布:Claude Opus 5 和 Fable 5 哪個好?

2026 年 7 月 24 日,Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),同步將其設為 Claude Max 預設模型,Claude Pro 使用者也可使用目前最強的 Opus 檔位。定價與 Opus 4.8 完全相同:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens;上下文視窗 100 萬 tokens(預設且唯一檔位),最大輸出 128K,Thinking 預設開啟。

官方 benchmark 關鍵資料

  • Frontier-Bench v0.1:軟體工程任務超越所有模型,表現是 Opus 4.8 的兩倍以上,單任務成本更低。
  • CursorBench 3.2:max effort 檔位與 Fable 5 峰值相差僅 0.5%,成本約為 Fable 5 的一半;high / xhigh / max 檔位的性價比均超過市面所有模型。
  • ARC-AGI 3:新穎問題解決得分是次優模型的3 倍
  • OSWorld 2.0:用不到 Fable 5 三分之一成本超過 Fable 5 最佳成績。
  • Zapier AutomationBench:端到端商業自動化通過率約為次優模型 1.5 倍,某工作流100% 通過(此前無模型完成)。

「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 團隊

Claude Opus 5 vs Fable 5 選型對比

維度Claude Opus 5Claude Fable 5
輸入/輸出單價$5 / $25 每百萬 token約 $10 / $50 每百萬 token(約為 Opus 5 兩倍)
CursorBench 3.2(max)與 Fable 5 峰值相差 0.5%當前編程/agent 峰值參考
資料留存預設存取不強制資料留存需接受 30 天資料留存政策
網路安全能力分類器比 Fable 5 寬鬆約 85%,可做原始碼級漏洞發現攔截更頻繁;雙用途前沿由 Mythos 5 佔據
產品定位Claude Max 預設 / Pro 最強 Opus旗艦定價,7 月 1 日起公眾可用
適用場景日常主力、合規敏感、追求性價比的生產 workload需要絕對峰值、可接受留存與更高單價的任務

Box 企業客戶實測:資料分析工作流提升 11%,盡職調查提升 17%,整體準確率提升 8%。生命科學方面,從光譜推斷分子結構內部測試比 Opus 4.8 高 10.2 個百分點,蛋白質序列變異功能預測高 7.7 個百分點

i

對齊與安全:Opus 5 是 Anthropic 迄今最對齊的模型——欺騙行為發生率最低、最難被誘導濫用;但在 offensive 網路安全與生物安全等雙用途類別上,Anthropic 故意未讓 Opus 5 刷新前沿,該位置仍由受限發行的 Mythos 5 保持。

03

Kimi K3 蒸餾門:白宮指控、時間線質疑與「Kimi K3 自稱是 Claude」

如果說 Opus 5 是「正常發新品」,Kimi K3 的劇情則複雜得多。月之暗面 7 月 16 日發布 K3,宣稱總引數 2.8 萬億——全球首個進入 3T 級的開源權重模型;稀疏 MoE(896 專家、每 token 啟動 16 個,約等效 500 億啟動引數),100 萬 token 上下文,原生視覺理解,架構為 Kimi Delta Attention(KDA)。

Kimi K3 引數量與基準(官方發布)

基準Kimi K3 分數備註
GPQA-Diamond93.5%發布時開源模型最高分
BrowseComp91.2%發布時最高分
Terminal-Bench 2.188.3%落後 GPT-5.6 Sol 0.5 分
SWE Marathon42.0%綜合最佳
完整權重開源承諾 7 月 27 日撰稿時外部尚無法獨立驗證

月之暗面 白宮 指控:發生了什麼?

2026 年 7 月 22–23 日,白宮 OSTP 主任 Michael Kratsios 在 X 發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提及涉嫌使用未獲出口許可的 Nvidia GB300 晶片(可能經泰國伺服器繞道)。財政部長 Scott Bessent 附和稱在「很多中國模型上發現了美國大模型的浮水印」,但未說明具體指什麼。

這並非首次:2026 年 2 月 Anthropic 已公開指控月之暗面、DeepSeek、MiniMax 進行「產業級蒸餾攻擊」,稱識別出月之暗面超過 340 萬次異常 API 互動,「明顯偏離正常使用模式」,並稱透過請求元資料追蹤到部分行為與月之暗面高層相關。月之暗面從未正面確認或否認。

!

時間線質疑:TechCrunch 採訪的多位研究者認為,Fable 5 自 7 月 1 日才公眾可用,到 K3 發布(7 月 16 日)僅兩週——「不可能在兩週內蒸餾足夠資料、訓練完模型並發布」。Snorkel AI 聯合創辦人 Braden Hancock 直言:「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation.」Allen Institute 的 Nathan Lambert 也指出,隨著中國模型逼近前沿,簡單蒸餾的邊際收益正在變小,真正拉開差距的是強化學習訓練。

Kimi K3 是不是抄襲 Claude?最硬核的技術信號

Redwood Research 首席科學家 Ryan Greenblatt(7 月 24 日前後,GitHub:rgreenblatt/which_claude_is_k3)對多個模型的身份自認行為做交叉熵對比,發現:

  • Kimi K3 被問「你是誰」時,異常高頻自稱 Claude,甚至吐出 Claude 官方內部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不會準確報出這類內部版本號。
  • K3 自稱版本鎖定在「Claude 4.5 時代」(2025 年末),而非當前 Fable/Mythos;上一代 K2 信號指向更早的 Claude Sonnet 4——呈現「逐代追新」規律。
示例輸出
問:你是誰?
Kimi K3(異常高頻):我是 Claude,版本 claude-opus-4-5-20250929
真實 Claude Opus 4.5:我是 Claude,通常不會報出上述內部部署 ID

Greenblatt 解讀:模型說出「教師模型」部署元資料,比教師模型自己還準確,很難用「模仿對話風格」解釋,更可能指向訓練資料混入了帶部署元資料標註的 Claude 資料(如 API 日誌或打標合成資料)。但他也強調:這不能直接證明蒸餾發生——身份混淆也可能來自資料污染或系統提示洩露。

社群 r/LocalLLaMA 上三方聲音並存:歡呼開源與閉源差距縮短到「天」而非「月」;調侃 2.8T 引數幾乎無人本地可跑;務實派認為 K3 真正賣點是低價 + 更少拒答,而非「打敗 Fable 5」。更多 K3 架構細節見本站Kimi K3 深度評測

04

六步 Runbook:本週 Claude Opus 5 / Kimi K3 怎麼選?

把兩條新聞放進同一張決策表,避免被標題帶節奏。以下六步可在團隊評審會上直接複用。

  1. 01

    先定合規邊界:若 workload 不能接受 30 天資料留存或需規避供應鏈/geo 風險,優先評估 Opus 5(預設不強制留存)而非 Fable 5;若考慮 K3,需單獨評估開源權重許可與 provenance 爭議。

  2. 02

    算任務總成本而非單價:用你自己的 golden prompt 集分別測 Opus 5 與 Fable 5 的 token 消耗與 pass rate;CursorBench 的 0.5% 差距在你的場景可能被 effort 檔位放大或縮小。

  3. 03

    區分「API 可用」與「權重可驗證」:K3 API 已上線但完整權重至 7 月 27 日;在權重放出前,架構聲明與跑分均無法被第三方完全復現。

  4. 04

    對蒸餾指控分層理解:政治層(白宮/Kratsios)→ 時間線層(TechCrunch 專家)→ 技術層(Greenblatt 身份統計);三層證據強度不同,勿混為一談。

  5. 05

    統一閘道降低切換成本:若需同時試用 Claude 與開源備選,可透過 OpenRouter 統一閘道配置 fallback 鏈,避免為每家單獨維護 SDK 與 Key 輪換邏輯。

  6. 06

    7 月 27 日後復評 K3:權重開源是本輪爭議的關鍵節點——屆時獨立研究者可驗證引數規模、架構與 benchmark 復現,建議把「是否納入生產」決策至少延後到該日期之後。

事件時間線速覽

日期事件
2026-02Anthropic 首次公開指控月之暗面/DeepSeek/MiniMax 產業級蒸餾
2026-07-01Claude Fable 5 面向公眾正式可用
2026-07-16Kimi K3 API/產品發布(2.8T 引數)
2026-07-22/23白宮 OSTP 主任 Kratsios 公開指控蒸餾 + 違規晶片
2026-07-24Claude Opus 5 發布;Greenblatt 發布 K3 身份統計
2026-07-27(計劃)Kimi K3 完整權重開源
05

可引用硬核資料:性價比才是這個階段的主戰場

兩件事連起來看,趨勢很清晰:Opus 5 用「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 用「開源 + 低價 + 少拒答」衝擊市場;圍繞 K3 的爭議,則是行業在問——你的低價到底是技術優化換來的,還是「白嫖」別人的模型換來的?

  • Opus 5 / Fable 5 成本比:同 benchmark 檔位下 Opus 5 約為 Fable 5 一半單價,CursorBench max 差距 0.5%。
  • K3 規模:2.8T 總引數、896 專家 MoE、100 萬 token 上下文;GPQA-Diamond 93.5%、BrowseComp 91.2%。
  • 蒸餾間接證據:K3 自稱 Claude 4.5 時代內部 ID;Anthropic 2 月指控 340 萬+ 異常 API 互動——均非終局證明,但構成目前最完整證據鏈。

若你的 Agent 或 CI 流水線需要7×24 穩定呼叫 Claude API、跑長任務 benchmark 或做多模型 A/B,把 Gateway 和 Runner 放在會休眠的本地筆電上,常遇到網路中斷、程序被殺、DerivedData 與金鑰散落多機等問題——維護成本往往高於模型 token 本身。對於更穩定、更適合 iOS CI/CD 與 AI Agent 自動化生產的場景,VpsMesh 的 Mac Mini 雲端租用通常是更優解:實體 Apple Silicon 節點、可按專案週期彈性租用,Agent 與建構任務可持續執行而不依賴個人裝置在線。詳情見Mac Mini M4 租用定價雲端說明中心雲端訂購

FAQ

常見問題

Opus 5 維持 $5/$25 每百萬輸入/輸出 token,約為 Fable 5($10/$50 量級)的一半;CursorBench 3.2 max effort 與 Fable 5 峰值相差不到 1%。若你主要做日常 coding/agent 任務,Opus 5 通常是更優性價比選擇。跑 Agent 基準測試可參考雲端說明中心的遠端 Mac 配置說明。

是的。2026 年 7 月 24 日發布當天起,Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強 Opus 版本。可透過 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry 存取,模型 ID 為 claude-opus-5。

截至本文發布,這仍是有爭議、未被最終證實的指控。白宮指控缺乏公開證據;獨立專家從時間線質疑兩週內完成深度蒸餾不現實;Ryan Greenblatt 發現的「K3 自稱是 Claude 並吐出內部版本號」是目前最具技術含量的間接證據,但也不能直接證明蒸餾發生。

官方承諾 2026 年 7 月 27 日放出完整權重。本文發布時外部研究者尚無法完全獨立驗證 K3 的架構細節與 benchmark 復現——這也是輿論持續發酵的重要原因之一。

Redwood Research 的 Ryan Greenblatt 統計分析顯示,K3 在被問身份時異常高頻自稱 Claude,甚至吐出 claude-opus-4-5-20250929 等 Anthropic 內部部署 ID——比真實 Claude 模型自己報得還準。更可能解釋是訓練資料混入了帶部署元資料標註的 Claude 資料,但 Greenblatt 強調這不能單獨作為蒸餾成立的終局證明。