Claude Opus 5 вдвое дешевле и почти догоняет Fable 5
Kimi K3 называет себя Claude

Opus 5 · Opus vs Fable 5 · дистилляция K3 · Greenblatt · runbook из 6 шагов

Claude Opus 5 и скандал с дистилляцией Kimi K3

Разработчики, отслеживающие релизы моделей этой недели, получили два сюжета с одной сквозной темой: frontier-интеллект по доступной цене — и откуда на самом деле берётся эта мощность. 24 июля Anthropic выпустила Claude Opus 5 как модель по умолчанию для Claude Max. 16 июля Moonshot AI представила Kimi K3, после чего Белый дом обвинил компанию в промышленной дистилляции, а независимый исследователь Ryan Greenblatt зафиксировал, что K3 называет себя Claude и выводит внутренние deployment ID. В статье — таблица Opus 5 vs Fable 5, таймлайн скандала с дистилляцией, разбор технических доказательств Greenblatt и runbook из 6 шагов, со ссылками на обзор Kimi K3 и гайд OpenRouter.

01

Два заголовка и пять ловушек при выборе модели на этой неделе

Anthropic сжала разрыв между флагманом и рабочей моделью. Moonshot ответила open-weight релизом на 2,8T с API в разы дешевле frontier-конкурентов. За 72 часа новостного окна команды часто ошибаются в пяти предсказуемых точках.

  1. 01

    Пресс-релиз принимают за верифицированную способность: полные веса K3 обещаны только 27 июля; внешние исследователи не могли воспроизвести бенчмарки на пике скандала. У Opus 5 есть официальные цифры, но ваш workload может не совпасть с CursorBench.

  2. 02

    Путают цену за токен с ценой задачи: Opus 5 сохраняет тариф Opus 4.8 ($5/$25 за миллион токенов), но Thinking включён по умолчанию; effort-уровни меняют длину выхода. Fable 5 стоит примерно вдвое дороже, но опережает на 0,5% при max effort на CursorBench 3.2.

  3. 03

    Игнорируют retention и compliance: Fable 5 и Mythos 5 требуют opt-in на 30-дневное хранение данных. Opus 5 следует прежней политике Opus — без принудительного retention для общего доступа, что для enterprise может быть важнее дельты бенчмарков.

  4. 04

    Политическое обвинение путают с доказательством: директор OSTP Michael Kratsios обвинил Moonshot в скрытой промышленной дистилляции без публикации supporting evidence. Независимые исследователи сомневаются, что глубокая дистилляция из Fable 5 — публичного с 1 июля — возможна за две недели.

  5. 05

    Не замечают сигнал identity confusion: анализ Greenblatt показывает, что K3 аномально часто называет себя Claude и выводит строки вроде claude-opus-4-5-20250929. Это технически содержательнее заголовка — но не доказывает дистилляцию.

02

Claude Opus 5: стоит ли переключаться с Fable 5?

24 июля 2026 Anthropic выпустила Claude Opus 5 (model ID: claude-opus-5) и сразу сделала её моделью по умолчанию в Claude Max — самой мощной версией Opus для подписчиков Claude Pro. Цена не изменилась относительно Opus 4.8: $5 за миллион входных, $25 за миллион выходных токенов. Контекст 1M (один tier), max output 128K, Thinking по умолчанию включён.

Ключевые опубликованные бенчмарки

  • Frontier-Bench v0.1: опережает все модели на software engineering задачах более чем в 2× относительно Opus 4.8 при более низкой стоимости задачи.
  • CursorBench 3.2: в пределах 0,5% от пика Fable 5 при max effort при примерно половинной стоимости задачи; лучший performance-per-dollar на high, xhigh и max tier.
  • ARC-AGI 3: лучше следующей модели на novel problem solving.
  • OSWorld 2.0: обходит лучший результат Fable 5 при трети стоимости.
  • Zapier AutomationBench: лидерборд; 100% pass rate на end-to-end workflow, который ни одна модель ранее не завершила.

«Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.» — команда Cursor

Сравнение Claude Opus 5 vs Fable 5

ИзмерениеClaude Opus 5Claude Fable 5
Цена input/output$5 / $25 за миллион токенов~$10 / $50 (~2× Opus 5)
CursorBench 3.2 (max)В пределах 0,5% от пика Fable 5Текущий эталон coding/agent peak
Data retentionБез принудительного retention для общего доступаТребует opt-in на 30-дневное хранение
Кибербезопасность~85% меньше intervention vs Fable 5; пригоден для source-level vuln discoveryЧаще блокирует; dual-use frontier у Mythos 5
ПозиционированиеClaude Max default / сильнейший Opus для ProФлагманский pricing; публичен с 1 июля
Лучше дляЕжедневный production, compliance-sensitive, cost-aware agent workloadsАбсолютный peak, где retention и 2× cost допустимы

Enterprise-клиент Box сообщил о +8% общей точности — +11% на data-analysis и +17% на due-diligence vs предыдущих моделей. Внутренние тесты life-sciences: +10,2 пункта на inferring molecular structure from spectroscopy и +7,7 на protein variant function prediction vs Opus 4.8.

Alignment: Opus 5 — наиболее aligned модель Anthropic на сегодня: минимальный deceptive behavior rate, сложнее провоцировать на misuse. Anthropic намеренно не выводила Opus 5 на frontier offensive cyber/biology — этот слот остаётся у Mythos 5.

03

Скандал с дистилляцией Kimi K3: украла ли Moonshot Claude?

16 июля 2026 Moonshot AI выпустила Kimi K3 с заявленными 2,8 трлн параметров — первая open-weight модель, перешагнувшая отметку 3T. Sparse MoE: 896 experts, 16 active per token (~50B active-parameter equivalent), контекст 1M, native vision, архитектура Kimi Delta Attention (KDA).

Снимок официальных бенчмарков

БенчмаркScore K3Примечание
GPQA-Diamond93,5%Лучший open-weight score на момент релиза
BrowseComp91,2%Лидер категории на момент релиза
Terminal-Bench 2.188,3%0,5 пункта позади GPT-5.6 Sol
SWE Marathon42,0%Лидер категории overall
Полные весаОбещаны 27 июляНа пике скандала не верифицируются независимо

Обвинение Белого дома

22–23 июля директор OSTP Michael Kratsios опубликовал в X обвинение Moonshot в «large-scale, covert industrial distillation aimed at stealing proprietary U.S. technology» из Fable model Anthropic — и отдельно заявил об export-restricted Nvidia GB300, полученных через серверы в Таиланде. Минфин Scott Bessent сказал, что чиновники «finding watermarks of our U.S. large language models on many of the Chinese models», не определив, что это означает технически.

Это не первый раунд: в феврале 2026 Anthropic публично назвала Moonshot, DeepSeek и MiniMax, заявив о более чем 3,4 млн аномальных API-взаимодействий, отражающих «deliberate capability extraction», часть активности привязана к senior Moonshot staff через request metadata. Moonshot публично не подтверждала и не опровергала.

Контраргумент по timeline: TechCrunch опросил исследователей, скептичных к дистилляции как объяснению K3 — Fable 5 публичен только с 1 июля, остаётся две недели на distill, train и ship. Braden Hancock (Snorkel AI): «You can't distill that much data, train a model, and release it in two weeks.» Nathan Lambert (Allen Institute for AI): marginal impact дистилляции снижается по мере перехода китайских лабораторий на reinforcement learning.

Почему Kimi K3 называет себя Claude: технический разбор

Около 24 июля chief scientist Redwood Research Ryan Greenblatt (GitHub: rgreenblatt/which_claude_is_k3) опубликовал статистическое сравнение self-identification behavior моделей. Результат:

  • Kimi K3 аномально часто идентифицирует себя как Claude и иногда выводит точные Anthropic deployment ID вроде claude-opus-4-5-20250929 и claude-sonnet-4-5-20250929.
  • Настоящий Claude Sonnet 4.5 говорит «I'm Claude Sonnet 4.5.» Настоящий Opus 4.5 не выдаёт эти internal strings с такой точностью.
  • Утечка identity у K3 указывает на эпоху «Claude 4.5» (конец 2025), не на текущие Fable/Mythos; у Kimi K2 ранее был сигнал на более ранний Claude Sonnet 4 — паттерн поколение за поколением.
example
Q: Кто ты?
Kimi K3 (аномально часто): I am Claude, version claude-opus-4-5-20250929
Настоящий Claude Opus 4.5: Обычно не сообщает этот internal deployment ID

Интерпретация Greenblatt: воспроизведение deployment metadata teacher model точнее, чем teacher сообщает о себе, сложно объяснить conversational mimicry. Указывает на обучение на данных Claude с метаданными деплоя — API logs или tagged synthetic data. Он подчёркивает: это не доказывает дистилляцию; contamination или leaked prompts остаются альтернативами.

Реакция r/LocalLLaMA делится на три лагеря: excitement, что open-closed gap измеряется днями; шутки, что 2,8T локально почти никто не запустит; и трезвый взгляд — реальная ценность K3 в цене и меньшем числе refusals, а не в обгоне Fable 5. Подробнее об архитектуре — в нашем обзоре Kimi K3.

04

Runbook из 6 шагов: Opus 5 или Kimi K3 на этой неделе

Используйте этот checklist на team review вместо реакции на заголовки.

  1. 01

    Сначала compliance boundaries: если 30-day retention или geo/supply-chain risk неприемлемы — приоритет Opus 5 (без forced retention) над Fable 5; при рассмотрении K3 оценивайте open-weight license и provenance controversy отдельно.

  2. 02

    Считайте total task cost, не list price: прогоните golden prompt set на Opus 5 vs Fable 5 и сравните token burn плюс pass rate; gap 0,5% на CursorBench может расшириться или сжаться с effort settings.

  3. 03

    Разделяйте API availability и weight verifiability: K3 API live, но полные веса — 27 июля; architecture claims и scores нельзя полностью воспроизвести до этого момента.

  4. 04

    Стратифицируйте evidence по дистилляции: political (White House/Kratsios) → timeline (TechCrunch experts) → technical (Greenblatt identity stats). Не сводите в один verdict.

  5. 05

    Снижайте switching cost через gateway: для trial Claude рядом с open alternatives настройте fallback chains по нашему гайду OpenRouter вместо отдельных SDK stacks на vendor.

  6. 06

    Переоцените K3 после 27 июля: open weights — ключевой node; отложите production adoption до независимой верификации parameters, architecture и benchmark reproduction.

Таймлайн событий

ДатаСобытие
2026-02Первое публичное обвинение Anthropic в дистилляции vs Moonshot/DeepSeek/MiniMax
2026-07-01Claude Fable 5 публично доступен
2026-07-16Запуск Kimi K3 API/product (2,8T parameters)
2026-07-22/23Обвинение OSTP в дистилляции + chip accusation
2026-07-24Релиз Claude Opus 5; identity analysis Greenblatt
2026-07-27 (план)Полные open weights Kimi K3
05

Жёсткие цифры: price-performance — главное поле боя

Паттерн очевиден. Anthropic закрывает pricing gap flagship-vs-daily через Opus 5. Moonshot давит open-weight, ultra-cheap, largely unrestricted access через K3. Скандал по сути спрашивает: когда лаборатория заявляет frontier performance за долю цены, как отличить лучшую инженерию от тихой езды на чужой модели?

  • Opus 5 / Fable 5 cost ratio: ~половина per-token price на comparable tiers; gap 0,5% на CursorBench max.
  • Масштаб K3: 2,8T total params, 896-expert MoE, 1M context; GPQA-Diamond 93,5%, BrowseComp 91,2%.
  • Indirect signals дистилляции: K3 self-ID как Claude 4.5-era internal strings; claim Anthropic от февраля о 3,4M+ anomalous API calls — информативно, не conclusive.

Если agent pipeline или CI workflow требуют стабильного 24/7 доступа к Claude API, длинных benchmark runs или multi-model A/B tests, gateway и runners на спящем ноутбуке дают network drops, killed processes и разброс secrets — часто дороже, чем сами токены. VM добавляют overhead и риск EULA. Для production iOS CI/CD и автоматизации AI-агентов аренда Mac Mini в облаке VpsMesh обычно оптимальнее: dedicated Apple Silicon nodes по проектному циклу, чтобы agents и builds работали без вашей личной машины online. См. цены аренды Mac Mini M4.

FAQ

Частые вопросы

Opus 5 остаётся на $5/$25 за миллион входных/выходных токенов — примерно вдвое дешевле Fable 5 (~$10/$50). На CursorBench 3.2 max effort отставание от пика Fable 5 около 0,5%. Для ежедневного coding и agent tasks Opus 5 обычно лучше по value. Настройка remote Mac для agent benchmarks — в центре помощи.

Да. С 24 июля 2026 Opus 5 — default в Claude Max и сильнейший Opus для Claude Pro. Доступ через Claude API, AWS Bedrock, Google Vertex AI и Microsoft Foundry под model ID claude-opus-5.

Не подтверждено и оспаривается. Обвинение Белого дома без публичных доказательств. Исследователи считают двухнедельное окно Fable-to-K3 нереалистичным для deep distillation. Finding Greenblatt, что K3 называет себя Claude с exact deployment IDs — сильнейший технический (но non-conclusive) сигнал на сегодня.

Moonshot обещает 27 июля 2026. На момент публикации веса недоступны — architecture и benchmark claims нельзя независимо верифицировать, поэтому скандал остаётся открытым.

Статистический анализ Greenblatt: K3 аномально часто идентифицирует себя как Claude и иногда выводит internal deployment IDs Anthropic вроде claude-opus-4-5-20250929 — точнее, чем сами модели Claude. Наиболее правдоподобно — обучение на данных Claude с deployment metadata, но Greenblatt подчёркивает: это alone не доказывает дистилляцию. Тарифы bare-metal macOS для CI — на странице цен аренды Mac Mini M4.