DeepSeek V4-Flash действительно в 100 раз дешевле Claude?

0731 post-training · Harness · сравнение конкурентов · оговорки по бенчмаркам · сроки V4-Pro

DeepSeek V4 Flash официальный релиз: бенчмарки и сравнение цен API

31 июля 2026 года DeepSeek перевёл V4-Flash-0731 в официальную public API-сборку: та же архитектура 284B / 13B active, что в апрельском preview, прирост полностью от повторного post-training. На agent-бенчмарках модель обходит более крупный V4-Pro preview при цене примерно в 1/36–1/179 от Claude Opus 4.8. Если вы оцениваете достоверность бенчмарков, сравниваете с Kimi K3 или Qwen3.8-Max или мигрируете с устаревших alias deepseek-chat, здесь — хронология релиза, таблица цен, разбор Harness, сравнение конкурентов, шестишаговый runbook и оговорки по бенчмаркам. Данные на 2026-08-05.

01

Что вышло 31 июля — и что нет

Фраза «официальная версия DeepSeek V4» легко читается как новая модель. Это не так: та же 284B-архитектура с повторным post-training. Флагманский официальный V4-Pro и первый in-house agent framework Harness по-прежнему не выпущены, без подтверждённой даты.

  1. 01

    24 апреля 2026: preview DeepSeek-V4 с двумя open-weight MoE (MIT) — V4-Pro (1.6T / 49B active) и V4-Flash (284B / 13B active), оба с контекстом 1M токенов. См. разбор GA DeepSeek V4.

  2. 02

    24 июля 2026: legacy alias deepseek-chat и deepseek-reasoner отключены; весь трафик идёт на семейство V4.

  3. 03

    27 июля 2026: Moonshot AI публикует open weights Kimi K3 (2.8T total params), усиливая давление за несколько дней до обновления DeepSeek. См. гайд по Kimi K3.

  4. 04

    31 июля 2026: V4-Flash-0731 переведён в official public API beta; open weights на Hugging Face в тот же день. Changelog впервые называет DeepSeek Harness — «to be released soon». Критично: обновление только API — consumer app и web chat не затронуты.

  5. 05

    2 августа 2026: API Qwen3.8-Max от Alibaba выходит в GA; weights ещё не опубликованы. См. разбор Qwen3.8-Max.

  6. 06

    На 5 августа 2026: официальный V4-Pro не подтверждён. Китайские СМИ со ссылкой на безымянные источники пишут о внутреннем тестировании с 28 июля и возможном GA 10–20 августа — окно не подтверждено DeepSeek и должно считаться слухом.

При отслеживании релиза команды часто упираются в пять слепых зон:

  1. 01

    «Официальная версия» ≠ новая модель: архитектура и число параметров идентичны апрельскому preview — прирост только от post-training.

  2. 02

    Зависимость бенчмарков от harness: agent-оценки сняты на неопубликованном «minimal mode» Harness, а не на сторонних agent tools.

  3. 03

    API-only: consumer app и web chat не обновлены до сборки 0731.

  4. 04

    Пробел V4-Pro: официальный флагман недоступен; для сложного reasoning может понадобиться preview.

  5. 05

    Слухи о финансировании: сообщения о раунде ~$7.4B и оценке ~$48.7B идут из финансовых СМИ без подтверждения DeepSeek или регуляторных filings.

02

Цифры: цены, параметры и лицензия

МодельСтатусTotal / active paramsКонтекстInput (miss / hit, $/M)Output ($/M)Лицензия
DeepSeek-V4-Flash-0731Official (31.07.2026)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-ProТолько preview (24.04.2026)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Open weights (27.07.2026)2.8T / ~104B (оценка сообщества)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2Open (июнь 2026)~744B / ~40B1MНе провереноНе провереноMIT
Qwen3.8-MaxAPI GA (02.08.2026); weights pending2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00Open weights обещаны
i

Все цены — vendor-published rates. DeepSeek анонсировал будущую 2× наценку в peak hours (09:00–12:00 и 14:00–18:00 по Пекину) без подтверждённой даты. Относительно Claude Opus 4.8: cache-miss input примерно в 36 раз дешевле, cache-hit input около 179 раз, output около 89 раз за миллион токенов (по 21st Century Business Herald со ссылкой на официальные тарифы).

03

Post-training и Harness: откуда взялась производительность

Архитектура не менялась — менялись training data

V4-Flash-0731 идентичен по размеру и структуре апрельскому preview. DeepSeek заявляет, что весь скачок на agent-бенчмарках — от повторного post-training, а не от масштабирования. Это противоречит интуиции «больше = лучше»: модель 284B/13B обходит 1.6T/49B из того же семейства на нескольких agentic задачах, что подчёркивает роль качества post-training в конкуренции второй половины 2026 года.

Hybrid attention: CSA + HCA, mHC и оптимизатор Muon

Техотчёт «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три архитектурных изменения из апрельского preview:

  1. 01

    Hybrid attention (DSA): Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA) снижают compute и memory на длинном контексте.

  2. 02

    Manifold-Constrained Hyper-Connections (mHC): улучшение стандартных residual connections.

  3. 03

    Оптимизатор Muon: более быстрая сходимость и стабильность обучения.

DeepSeek заявляет: при контексте 1M токенов V4-Pro требует лишь 27% per-token inference FLOPs и 10% KV cache footprint относительно V3.2. Это vendor-reported метрики; независимого воспроизведения пока нет.

Harness: первый in-house agent framework DeepSeek

31 июля — первое официальное упоминание DeepSeek Harness: in-house agent execution framework для file I/O, tool calls и многошаговых инженерных задач — ответ DeepSeek на Claude Code, которым команды пользовались до сих пор. Каждый agent-бенчмарк для V4-Flash-0731 (Terminal Bench 2.0, Toolathlon и др.) снят в «minimal mode» Harness, который ещё не опубликован, при max reasoning effort, top_p 0.95, temperature 1.0. Changelog предупреждает, что agent scores «extremely sensitive to harness choice» — это стоит принять буквально.

04

Сравнение конкурентов и оговорки по бенчмаркам

МодельLabIntelligence Index (Artificial Analysis)Средняя стоимость задачиОфициальные agent-оценки DeepSeek
V4-Flash-0731DeepSeek50$0.03Terminal Bench 2.0: 82.7 (Harness minimal mode)
Kimi K3Moonshot AI57$0.86
GLM-5.2Zhipu / Z.ai~1 пункт выше V4-FlashНе проверено
GPT-5.6 SolOpenAI9+ пунктов выше V4-Flash$1.86Closed source
Claude Fable 5Anthropic9+ пунктов выше V4-Flash$3.15Closed source

DeepSeek не борется за вершину leaderboard — стратегия «достаточный интеллект по цене, которую другие не повторят». Стоимость задачи — примерно 1/29 от Kimi K3 и 1/105 от Claude Fable 5.

!

Оговорки по бенчмаркам: 1) Terminal Bench 2.0 — 82.7 (vs 67.9 у V4-Pro preview) на неопубликованном Harness minimal mode при max settings; 2) зарубежные разработчики сообщают о низком cache-hit rate и timeout safety classifier; 3) даты V4-Pro / Harness — неподтверждённые слухи СМИ; 4) отчёты о финансировании и IPO — без официальных filings.

05

Шестишаговый runbook выбора API: от миграции до production routing

V4-Flash-0731 поддерживает OpenAI- и Anthropic-compatible API и встраивается в Claude Code, OpenCode, Cursor и другие agent toolchains. Шесть шагов от оценки до production:

  1. 01

    Аудит legacy-вызовов: найти в коде deepseek-chat / deepseek-reasoner, зафиксировать месячный объём и baseline cache-hit rate.

  2. 02

    Смена model naming: deepseek-chatdeepseek-v4-flash (non-thinking); deepseek-reasoner → Flash thinking mode или preview deepseek-v4-pro. Base URL без изменений.

  3. 03

    Стратегия cache: мониторить input cache-hit — сообщество отмечает более низкий hit rate у official build, что бьёт по счёту; сначала протестировать Prompt Caching на long-context.

  4. 04

    A/B с конкурентами: прогнать свои samples через Kimi K3 ($3/$15), Qwen3.8-Max ($2/$6) и V4-Flash ($0.14/$0.28) по latency, success rate и cost per task.

  5. 05

    Agent host environment: Harness пока не public — в production использовать Claude Code или OpenCode; после GA Harness перепроверить Terminal Bench–class задачи.

  6. 06

    Primary/backup routing и мониторинг: batch через V4-Flash; сложный reasoning — V4-Pro preview или Claude как fallback; cost caps и алерты на peak-hour 2× surcharge.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analyze this code..."}]
)
06

Отраслевой контекст, цифры и место VpsMesh

  • Эффект «kill line» (斩杀线): в китайских dev-кругах так называют порог «достаточная производительность + минимальная цена», который DeepSeek задаёт конкурентам. Это объясняет, например, сообщённое снижение цен GPT-5.6 Luna на 80% в тот же период.
  • Разворот настроений: до V4-Flash-0731 основателя Liang Wenfeng называли «Liang Empty Promise» из-за задержки V4-Pro; после превышения ожиданий Flash вернули «Liang the Sage» — быстрый барометр sentiment в китайском AI-сообществе.
  • Сдержанная реакция chip stocks: 31 июля Nvidia, Broadcom и AMD почти не сдвинулись — контраст с early 2025, когда DeepSeek-R1 вызвал глобальный selloff AI-чипов. Рынок воспринимает «DeepSeek делает больше с меньшим compute» как рутинную инженерию.
  • Объём вызовов OpenRouter: preview V4-Flash семь недель подряд лидировал в рейтинге most-used model — ядро аудитории: массовые low-cost agent calls, а не погоня за leaderboard.
  • Terminal Bench 2.0: официально 82.7 vs 67.9 у V4-Pro preview — но на неопубликованном Harness; до independent reproduction считать vendor-reported.

Чистые API-вызовы закрывают agent inference V4-Flash, но iOS signing chains, локальные Xcode builds, Metal workloads и 7×24 agent long-runs требуют реальных macOS-узлов — ноутбук не держит persistent OpenClaw / Claude Code agents, VM даёт performance tax и EULA risk. Для production iOS CI/CD и AI agent automation облачная аренда Mac Mini VpsMesh обычно лучше: bare-metal Apple Silicon, root access и предсказуемый monthly cost в паре с DeepSeek API в архитектуре «cloud inference + local build». Локальный inference: гайд ds4 + V4 Flash; тарифы — цены аренды Mac Mini M4.

Источники: официальная документация и changelog DeepSeek · технический отчёт · Artificial Analysis · 21st Century Business Herald · Kuai Technology · обсуждение V2EX. Перед production сверьте актуальные цены, бенчмарки и статус V4-Pro/Harness.

FAQ

Часто задаваемые вопросы

Да. V4-Pro и V4-Flash, включая официальную сборку V4-Flash-0731 от 31 июля, публикуются как open weights под MIT на Hugging Face и могут использоваться, дообучаться и распространяться коммерчески без дополнительных разрешений.

По данным 21st Century Business Herald, официальный V4-Flash примерно в 36 раз дешевле Claude Opus 4.8 на cache-miss input, около 179 раз на cache-hit input и около 89 раз на output за миллион токенов. Это vendor list prices, не независимый аудит.

Подтверждённой даты нет. Changelog DeepSeek говорит только, что официальный V4-Pro «will follow as soon as possible». Окно GA 10–20 августа из китайских СМИ не подтверждено. Для agent host deployment см. цены аренды Mac Mini M4.

Частично. SWE-bench Verified и другие прозрачные сторонние бенчмарки весят больше. Agent-оценки (Terminal Bench 2.0, Toolathlon и др.) сняты на неопубликованном Harness, и компания предупреждает о высокой чувствительности к выбору harness — дождитесь independent reproduction через Claude Code, Cursor и другие agent tools.

Первый собственный agent execution framework DeepSeek — in-house альтернатива Claude Code для редактирования файлов, tool calls и многошаговых инженерных задач. Впервые назван в changelog от 31.07.2026 и пока недоступен публично.

При доступе к DeepSeek через OpenAI- или Anthropic-format API код менять не нужно — deepseek-v4-flash автоматически указывает на новую official build. Если ещё вызываете отключённые deepseek-chat / deepseek-reasoner, переключитесь немедленно. Подробности развёртывания — в центре помощи.