Claude Opus 5 价格减半逼近旗舰
Kimi K3 却陷「自称 Claude」蒸馏门

Opus 5 发布 · Fable 5 性价比对比 · 白宫指控 · K3 身份混淆技术证据 · 六步选型 Runbook

Claude Opus 5 发布与 Kimi K3 蒸馏门争议

正在跟进本周大模型发布的开发者与技术决策者同时面对两条看似无关、实则都指向「性价比与能力来源」的线索:7 月 24 日 Anthropic 发布 Claude Opus 5 并设为 Claude Max 默认模型;7 月 16 日月之暗面发布的 Kimi K3 则遭白宫公开指控「工业级蒸馏」,独立研究者还发现 K3 会自称是 Claude 并吐出内部部署 ID。本文给出 Opus 5 vs Fable 5 对比表蒸馏争议完整时间线Greenblatt 技术证据解读六步 Runbook,并与Kimi K3 深度评测OpenRouter 多模型接入教程互链。

01

本周 AI 圈两大事件:开发者常见的五类选型盲区

Anthropic 用 Opus 5 回应「旗舰太贵」的市场压力;Moonshot 用 K3 的 2.8T 参数与低价冲击开源赛道。但在信息过载的 72 小时窗口里,团队很容易在以下五个环节做出误判 🔍

  1. 01

    把「新闻发布」当「可验证能力」:K3 完整权重承诺 7 月 27 日才放出,争议爆发时外部无法复现基准;Opus 5 虽已有官方 benchmark,但你的 workload 可能与 CursorBench 差异很大。

  2. 02

    混淆 token 单价与任务总成本:Opus 5 与 Opus 4.8 单价相同,但 Thinking 默认开启、effort 档位影响输出长度;Fable 5 虽贵一倍,max effort 峰值仍高 0.5%。

  3. 03

    忽视合规与数据留存条款:Fable 5 / Mythos 5 需接受 30 天数据留存;Opus 5 延续历代 Opus「默认不强制留存」——对企业场景可能是比 benchmark 更硬的筛选条件。

  4. 04

    把政治指控当技术结论:白宫 OSTP 主任 Kratsios 的「工业级蒸馏」指控未附公开证据;独立研究者从两周时间线角度普遍质疑「Fable 5 公开仅 15 天即完成深度蒸馏」的可行性。

  5. 05

    忽略「身份混淆」这一间接信号:Ryan Greenblatt 的统计显示 K3 自称 Claude 并吐出 claude-opus-4-5-20250929 等内部 ID——这比新闻标题更有技术含金量,但也不能直接等同「蒸馏已证实」。

02

Claude Opus 5 发布:Claude Opus 5 和 Fable 5 哪个好?

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用目前最强的 Opus 档位。定价与 Opus 4.8 完全相同:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens;上下文窗口 100 万 tokens(默认且唯一档位),最大输出 128K,Thinking 默认开启。

官方 benchmark 关键数据

  • Frontier-Bench v0.1:软件工程任务超越所有模型,表现是 Opus 4.8 的两倍以上,单任务成本更低。
  • CursorBench 3.2:max effort 档位与 Fable 5 峰值相差仅 0.5%,成本约为 Fable 5 的一半;high / xhigh / max 档位的性价比均超过市面所有模型。
  • ARC-AGI 3:新颖问题解决得分是次优模型的3 倍
  • OSWorld 2.0:用不到 Fable 5 三分之一成本超过 Fable 5 最佳成绩。
  • Zapier AutomationBench:端到端商业自动化通过率约为次优模型 1.5 倍,某工作流100% 通过(此前无模型完成)。

「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」—— Cursor 团队

Claude Opus 5 vs Fable 5 选型对比

维度Claude Opus 5Claude Fable 5
输入/输出单价$5 / $25 每百万 token约 $10 / $50 每百万 token(约为 Opus 5 两倍)
CursorBench 3.2(max)与 Fable 5 峰值相差 0.5%当前编程/agent 峰值参考
数据留存默认访问不强制数据留存需接受 30 天数据留存政策
网络安全能力分类器比 Fable 5 宽松约 85%,可做源码级漏洞发现拦截更频繁;双用途前沿由 Mythos 5 占据
产品定位Claude Max 默认 / Pro 最强 Opus旗舰定价,7 月 1 日起公众可用
适用场景日常主力、合规敏感、追求性价比的生产 workload需要绝对峰值、可接受留存与更高单价的任务

Box 企业客户实测:数据分析工作流提升 11%,尽职调查提升 17%,整体准确率提升 8%。生命科学方面,从光谱推断分子结构内部测试比 Opus 4.8 高 10.2 个百分点,蛋白质序列变异功能预测高 7.7 个百分点

对齐与安全:Opus 5 是 Anthropic 迄今最对齐的模型——欺骗行为发生率最低、最难被诱导滥用;但在 offensive 网络安全与生物安全等双用途类别上,Anthropic 故意未让 Opus 5 刷新前沿,该位置仍由受限发行的 Mythos 5 保持。

03

Kimi K3 蒸馏门:白宫指控、时间线质疑与「Kimi K3 自称是 Claude」

如果说 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面 7 月 16 日发布 K3,宣称总参数 2.8 万亿——全球首个进入 3T 级的开源权重模型;稀疏 MoE(896 专家、每 token 激活 16 个,约等效 500 亿激活参数),100 万 token 上下文,原生视觉理解,架构为 Kimi Delta Attention(KDA)。

Kimi K3 参数量与基准(官方发布)

基准Kimi K3 分数备注
GPQA-Diamond93.5%发布时开源模型最高分
BrowseComp91.2%发布时最高分
Terminal-Bench 2.188.3%落后 GPT-5.6 Sol 0.5 分
SWE Marathon42.0%综合最佳
完整权重开源承诺 7 月 27 日撰稿时外部尚无法独立验证

月之暗面 白宫 指控:发生了什么?

2026 年 7 月 22–23 日,白宫 OSTP 主任 Michael Kratsios 在 X 发文,指控月之暗面通过「大规模、隐蔽的产业级蒸馏」窃取 Anthropic Fable 模型能力,并提及涉嫌使用未获出口许可的 Nvidia GB300 芯片(可能经泰国服务器绕道)。财政部长 Scott Bessent 附和称在「很多中国模型上发现了美国大模型的水印」,但未说明具体指什么。

这并非首次:2026 年 2 月 Anthropic 已公开指控月之暗面、DeepSeek、MiniMax 进行「产业级蒸馏攻击」,称识别出月之暗面超过 340 万次异常 API 交互,「明显偏离正常使用模式」,并称通过请求元数据追踪到部分行为与月之暗面高层相关。月之暗面从未正面确认或否认。

时间线质疑:TechCrunch 采访的多位研究者认为,Fable 5 自 7 月 1 日才公众可用,到 K3 发布(7 月 16 日)仅两周——「不可能在两周内蒸馏足够数据、训练完模型并发布」。Snorkel AI 联合创始人 Braden Hancock 直言:「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation.」Allen Institute 的 Nathan Lambert 也指出,随着中国模型逼近前沿,简单蒸馏的边际收益正在变小,真正拉开差距的是强化学习训练。

Kimi K3 是不是抄袭 Claude?最硬核的技术信号

Redwood Research 首席科学家 Ryan Greenblatt(7 月 24 日前后,GitHub:rgreenblatt/which_claude_is_k3)对多个模型的身份自认行为做交叉熵对比,发现:

  • Kimi K3 被问「你是谁」时,异常高频自称 Claude,甚至吐出 Claude 官方内部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不会准确报出这类内部版本号。
  • K3 自称版本锁定在「Claude 4.5 时代」(2025 年末),而非当前 Fable/Mythos;上一代 K2 信号指向更早的 Claude Sonnet 4——呈现「逐代追新」规律。
示例输出
问:你是谁?
Kimi K3(异常高频):我是 Claude,版本 claude-opus-4-5-20250929
真实 Claude Opus 4.5:我是 Claude,通常不会报出上述内部部署 ID

Greenblatt 解读:模型说出「教师模型」部署元数据,比教师模型自己还准确,很难用「模仿对话风格」解释,更可能指向训练数据混入了带部署元数据标注的 Claude 数据(如 API 日志或打标合成数据)。但他也强调:这不能直接证明蒸馏发生——身份混淆也可能来自数据污染或系统提示泄露。

社区 r/LocalLLaMA 上三方声音并存:欢呼开源与闭源差距缩短到「天」而非「月」;调侃 2.8T 参数几乎无人本地可跑;务实派认为 K3 真正卖点是低价 + 更少拒答,而非「打败 Fable 5」。更多 K3 架构细节见本站Kimi K3 深度评测

04

六步 Runbook:本周 Claude Opus 5 / Kimi K3 怎么选?

把两条新闻放进同一张决策表,避免被标题带节奏。以下六步可在团队评审会上直接复用。

  1. 01

    先定合规边界:若 workload 不能接受 30 天数据留存或需规避供应链/geo 风险,优先评估 Opus 5(默认不强制留存)而非 Fable 5;若考虑 K3,需单独评估开源权重许可与 provenance 争议。

  2. 02

    算任务总成本而非单价:用你自己的 golden prompt 集分别测 Opus 5 与 Fable 5 的 token 消耗与 pass rate;CursorBench 的 0.5% 差距在你的场景可能被 effort 档位放大或缩小。

  3. 03

    区分「API 可用」与「权重可验证」:K3 API 已上线但完整权重至 7 月 27 日;在权重放出前,架构声明与跑分均无法被第三方完全复现。

  4. 04

    对蒸馏指控分层理解:政治层(白宫/Kratsios)→ 时间线层(TechCrunch 专家)→ 技术层(Greenblatt 身份统计);三层证据强度不同,勿混为一谈。

  5. 05

    统一网关降低切换成本:若需同时试用 Claude 与开源备选,可通过 OpenRouter 统一网关配置 fallback 链,避免为每家单独维护 SDK 与 Key 轮换逻辑。

  6. 06

    7 月 27 日后复评 K3:权重开源是本轮争议的关键节点——届时独立研究者可验证参数规模、架构与 benchmark 复现,建议把「是否纳入生产」决策至少延后到该日期之后。

事件时间线速览

日期事件
2026-02Anthropic 首次公开指控月之暗面/DeepSeek/MiniMax 产业级蒸馏
2026-07-01Claude Fable 5 面向公众正式可用
2026-07-16Kimi K3 API/产品发布(2.8T 参数)
2026-07-22/23白宫 OSTP 主任 Kratsios 公开指控蒸馏 + 违规芯片
2026-07-24Claude Opus 5 发布;Greenblatt 发布 K3 身份统计
2026-07-27(计划)Kimi K3 完整权重开源
05

可引用硬核数据:性价比才是这个阶段的主战场

两件事连起来看,趋势很清晰:Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 少拒答」冲击市场;围绕 K3 的争议,则是行业在问——你的低价到底是技术优化换来的,还是「白嫖」别人的模型换来的?

  • Opus 5 / Fable 5 成本比:同 benchmark 档位下 Opus 5 约为 Fable 5 一半单价,CursorBench max 差距 0.5%。
  • K3 规模:2.8T 总参数、896 专家 MoE、100 万 token 上下文;GPQA-Diamond 93.5%、BrowseComp 91.2%。
  • 蒸馏间接证据:K3 自称 Claude 4.5 时代内部 ID;Anthropic 2 月指控 340 万+ 异常 API 交互——均非终局证明,但构成目前最完整证据链。

若你的 Agent 或 CI 流水线需要7×24 稳定调用 Claude API、跑长任务 benchmark 或做多模型 A/B,把 Gateway 和 Runner 放在会休眠的本地笔记本上,常遇到网络中断、进程被杀、DerivedData 与密钥散落多机等问题——维护成本往往高于模型 token 本身。对于更稳定、更适合 iOS CI/CD 与 AI Agent 自动化生产的场景,VpsMesh 的 Mac Mini 云端租赁通常是更优解:实体 Apple Silicon 节点、可按项目周期弹性租用,Agent 与构建任务可持续运行而不依赖个人设备在线。详情见Mac Mini M4 租赁定价

FAQ

常见问题

Opus 5 维持 $5/$25 每百万输入/输出 token,约为 Fable 5($10/$50 量级)的一半;CursorBench 3.2 max effort 与 Fable 5 峰值相差不到 1%。若你主要做日常 coding/agent 任务,Opus 5 通常是更优性价比选择。跑 Agent 基准测试可参考帮助中心的远程 Mac 配置说明。

是的。2026 年 7 月 24 日发布当天起,Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强 Opus 版本。可通过 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry 访问,模型 ID 为 claude-opus-5。

截至本文发布,这仍是有争议、未被最终证实的指控。白宫指控缺乏公开证据;独立专家从时间线质疑两周内完成深度蒸馏不现实;Ryan Greenblatt 发现的「K3 自称是 Claude 并吐出内部版本号」是目前最具技术含量的间接证据,但也不能直接证明蒸馏发生。

官方承诺 2026 年 7 月 27 日放出完整权重。本文发布时外部研究者尚无法完全独立验证 K3 的架构细节与 benchmark 复现——这也是舆论持续发酵的重要原因之一。

Redwood Research 的 Ryan Greenblatt 统计分析显示,K3 在被问身份时异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929 等 Anthropic 内部部署 ID——比真实 Claude 模型自己报得还准。更可能解释是训练数据混入了带部署元数据标注的 Claude 数据,但 Greenblatt 强调这不能单独作为蒸馏成立的终局证明。