DeepSeek V4 — GA-релиз

Peak-valley pricing · 1M контекст · 80.6% SWE-bench · миграция до 24 июля

DeepSeek V4 GA релиз цены бенчмарки архитектура июль 2026

После трёх месяцев preview DeepSeek V4 официально вышел в general availability 20 июля 2026. Если вы спрашиваете, лучше ли DeepSeek V4, чем GPT-5.6, или всё ещё вызываете deepseek-chat в production — этот гайд для разработчиков: полный timeline, архитектура V4-Pro/Flash, таблицы бенчмарков, peak-valley pricing, честное сравнение с Claude Fable 5 и шестишаговый runbook миграции до дедлайна 24 июля. GA приносит апгрейды agent/math/code и time-based pricing — SWE-bench Verified достигает 80.6% (рекорд open-weight) при $0.87/M output off-peak. Данные на 20.07.2026.

01

Что изменилось в GA по сравнению с апрельским preview

Preview вышел 24 апреля 2026. Сегодняшний GA — не новая архитектура: preview переводится в production со стабильностью, оптимизацией и коммерческой дисциплиной ценообразования.

ДатаВеха
24 апр 2026Preview + MIT open source: V4-Pro (1.6T) и V4-Flash (284B)
Май 2026Production-tuned версии; API generally available
Июнь 2026Output V4-Pro снижен на 75% до $0.87/M токенов
29 июн 2026Email всем API-пользователям: GA в середине июля + первое раскрытие peak-valley pricing
19 июл 2026Gray-release тестеры; медиа сообщают о скором полном запуске
20 июл 2026GA live глобально
24 июл 2026deepseek-chat и deepseek-reasoner навсегда отключены (15:59 UTC)

Пять болевых точек, с которыми разработчики сталкиваются прямо сейчас:

  1. 01

    Legacy endpoints умрут через 4 дня: deepseek-chat и deepseek-reasoner перестанут работать 24 июля.

  2. 02

    Сложность peak pricing: в будние рабочие часы тарифы удваиваются — 24/7 пайплайнам нужен scheduling.

  3. 03

    Стоимость closed-моделей: Claude Fable 5 ~$50/M output и GPT-5.6 Sol ~$15/M съедают бюджет на масштабе.

  4. 04

    1M контекст только на бумаге: большинство моделей захлёбываются по памяти KV cache на длинном контексте.

  5. 05

    Суверенитет данных: closed API нельзя self-host для compliance-чувствительных нагрузок.

02

Архитектура: как DeepSeek делает 1M токенов практичными

СпецификацияV4-ProV4-Flash
Всего параметров1.6 триллиона284 миллиарда
Active per token49B (3%)13B (4.6%)
Слои6143
Context window1 000 000 токенов1 000 000 токенов
Max output384K384K
PrecisionFP4 (MoE experts) + FP8То же
Training data33T+ токенов32T+ токенов
LicenseMITMIT

CSA + HCA Hybrid Attention

V4 заменил MLA из V2/V3 двухтрековой системой. Compressed Sparse Attention (CSA) сжимает KV в 4 раза через softmax-gated pooling, использует FP4 lightning indexer (top-1024 Pro / top-512 Flash) плюс 128-token sliding window. Heavily Compressed Attention (HCA) сжимает в 128 раз, затем запускает dense global attention. Слои чередуют CSA и HCA.

На 1M токенов: V4-Pro использует 27% inference FLOPs V3.2; KV cache падает до 10% памяти V3.2 (Flash: 7%).

mHC и оптимизатор Muon

Manifold-Constrained Hyper-Connections (mHC) заменяют стандартные residuals 4-канальным потоком под управлением doubly stochastic matrix — стабильные градиенты через 61 слой. Muon (не AdamW) использует Newton-Schulz orthogonalization для более быстрого и стабильного обучения.

Три режима reasoning

РежимUse case
Non-thinkБыстрый routing, классификация, простой Q&A
Think HighОтладка, средняя сложность
Think MaxСложная математика, multi-step agents (384K+ context)

Рекомендуемый sampling: temperature=1.0, top_p=1.0 для всех режимов.

03

Бенчмарки: где V4 побеждает и где нет

БенчмаркV4-ProClaude Fable 5GPT-5.6 UltraOpus 4.8
SWE-bench Verified80.6% open record96.0%N/A~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench93.5%88.1%87.4%83.2%
Codeforces Elo3 206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

Artificial Analysis Strategy & Ops index: Fable 5 набирает 50 при $3.48/задача; V4-Pro — 38 при $0.03/задачав 116 раз дешевле при разрыве производительности 24%. V4-Flash остаётся ниже $0.04/задача во всех шести категориях индекса.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5: честное сравнение

ИзмерениеV4-ProGPT-5.6 SolClaude Fable 5
Open / self-hostableДа (MIT)НетНет
1M contextДаНе подтвержденоДа
Лучший coding (сложные репо)Второй tierВторой tierЛидирует SWE-bench Pro
Алгоритмы / математикаЛидер LiveCodeBenchСильный
Output (off-peak)$0.87/M~$15/M~$50/M
Output (peak)$1.74/M
Суверенитет данныхSelf-host возможенНетНет

Таблица peak-valley pricing

Часы пик (пекинское время): будни 09:00–12:00 и 14:00–18:00 — все тарифы удваиваются.

МодельСтатьяOff-PeakPeak
V4-ProInput (cache hit)$0.0035/M2x
Input (cache miss)$0.435/M$0.87/M
Output$0.87/M$1.74/M
V4-FlashInput (cache hit)$0.0028/M2x
Input (cache miss)$0.14/M$0.28/M
Output$0.28/M$0.56/M

Даже в peak output V4-Pro в 8.6 раз дешевле, чем Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).

Советы по экономии: планируйте batch jobs off-peak; максимизируйте prompt cache hits; направляйте простые запросы в V4-Flash; следите за email DeepSeek о смене billing (уведомление за 24 ч).

05

Runbook миграции: шесть шагов до 24 июля

Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут навсегда отключены.

Старое имяНовый эквивалент
deepseek-chatdeepseek-v4-flash (non-thinking)
deepseek-reasonerdeepseek-v4-flash (thinking) или deepseek-v4-pro
  1. 01

    Поиск по codebase: grep для deepseek-chat и deepseek-reasoner, включая env vars и CI configs.

  2. 02

    Выбор целевой модели: Flash для chat/routing; Pro для тяжёлого reasoning.

  3. 03

    Обновление OpenAI SDK: меняется только model; base_url остаётся https://api.deepseek.com.

  4. 04

    Включение thinking mode: используйте extra_body с конфигом thinking вместо поведения reasoner.

  5. 05

    Тест в staging: проверьте core flows; Think Max требует context window 384K+.

  6. 06

    Деплой до дедлайна: пользователи Anthropic SDK меняют только имя модели — тот же base URL.

python
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Solve step by step..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Цифры, которые стоит цитировать

  • SWE-bench Verified: 80.6% — лучший open-weight score
  • KV cache: 10% памяти V3.2 на 1M токенов
  • Cost ratio: $0.03 vs $3.48 за задачу vs Fable 5
  • Peak output: $1.74/M — всё ещё в 8.6 раз ниже closed frontier API
  • Дедлайн миграции: 24 июля 2026 15:59 UTC

GA-релиз не обязан обходить Claude Fable 5 на каждом бенчмарке. Он даёт сильнейшую open-weight coding-модель за 1/10–1/100 стоимости closed frontier API.

Self-hosting V4 или запуск long-context agents всё равно требует надёжного железа — ноутбук не держит 24/7, а VM добавляют риски по performance и compliance. Для production iOS CI/CD и AI agent automation аренда Mac Mini в облаке VpsMesh обычно лучший выбор: bare-metal Apple Silicon хорошо сочетается с локальными inference-стеками вроде ds4 + V4 Flash на Mac.

Источники: официальная документация DeepSeek, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.

FAQ

Часто задаваемые вопросы

Будние часы Пекина 09:00–12:00 и 14:00–18:00 удваивают все тарифы. V4-Pro off-peak output — $0.87/M; peak — $1.74/M. См. также цены аренды Mac Mini для сопоставимых затрат на dev-среду.

До 24 июля замените deepseek-chat на deepseek-v4-flash, а deepseek-reasoner — на Flash thinking mode или deepseek-v4-pro. Base URL без изменений.

Pro — флагман 1.6T (49B active); Flash — 284B (13B active). Оба поддерживают 1M context. Flash дешевле ($0.28/M output) для routing; Pro — для сложных agents.

Fable 5 и GPT-5.6 лидируют на самых сложных бенчмарках. V4-Pro под MIT, self-hostable и среди самых дешёвых frontier AI API в 2026 при $0.87/M off-peak output.

V4-Flash можно запустить через движки вроде ds4 на топовых Mac (96GB+ unified memory). Полный Pro требует cluster hardware. Детали настройки — в нашем центре помощи.

Апгрейды agent, math и code; peak-valley pricing; глобальная GA-доступность; legacy model names отключаются 24 июля. Базовая MoE-архитектура без изменений.