Peak-valley pricing · 1M контекст · 80.6% SWE-bench · миграция до 24 июля
После трёх месяцев preview DeepSeek V4 официально вышел в general availability 20 июля 2026. Если вы спрашиваете, лучше ли DeepSeek V4, чем GPT-5.6, или всё ещё вызываете deepseek-chat в production — этот гайд для разработчиков: полный timeline, архитектура V4-Pro/Flash, таблицы бенчмарков, peak-valley pricing, честное сравнение с Claude Fable 5 и шестишаговый runbook миграции до дедлайна 24 июля. GA приносит апгрейды agent/math/code и time-based pricing — SWE-bench Verified достигает 80.6% (рекорд open-weight) при $0.87/M output off-peak. Данные на 20.07.2026.
Preview вышел 24 апреля 2026. Сегодняшний GA — не новая архитектура: preview переводится в production со стабильностью, оптимизацией и коммерческой дисциплиной ценообразования.
| Дата | Веха |
|---|---|
| 24 апр 2026 | Preview + MIT open source: V4-Pro (1.6T) и V4-Flash (284B) |
| Май 2026 | Production-tuned версии; API generally available |
| Июнь 2026 | Output V4-Pro снижен на 75% до $0.87/M токенов |
| 29 июн 2026 | Email всем API-пользователям: GA в середине июля + первое раскрытие peak-valley pricing |
| 19 июл 2026 | Gray-release тестеры; медиа сообщают о скором полном запуске |
| 20 июл 2026 | GA live глобально |
| 24 июл 2026 | deepseek-chat и deepseek-reasoner навсегда отключены (15:59 UTC) |
Пять болевых точек, с которыми разработчики сталкиваются прямо сейчас:
Legacy endpoints умрут через 4 дня: deepseek-chat и deepseek-reasoner перестанут работать 24 июля.
Сложность peak pricing: в будние рабочие часы тарифы удваиваются — 24/7 пайплайнам нужен scheduling.
Стоимость closed-моделей: Claude Fable 5 ~$50/M output и GPT-5.6 Sol ~$15/M съедают бюджет на масштабе.
1M контекст только на бумаге: большинство моделей захлёбываются по памяти KV cache на длинном контексте.
Суверенитет данных: closed API нельзя self-host для compliance-чувствительных нагрузок.
| Спецификация | V4-Pro | V4-Flash |
|---|---|---|
| Всего параметров | 1.6 триллиона | 284 миллиарда |
| Active per token | 49B (3%) | 13B (4.6%) |
| Слои | 61 | 43 |
| Context window | 1 000 000 токенов | 1 000 000 токенов |
| Max output | 384K | 384K |
| Precision | FP4 (MoE experts) + FP8 | То же |
| Training data | 33T+ токенов | 32T+ токенов |
| License | MIT | MIT |
V4 заменил MLA из V2/V3 двухтрековой системой. Compressed Sparse Attention (CSA) сжимает KV в 4 раза через softmax-gated pooling, использует FP4 lightning indexer (top-1024 Pro / top-512 Flash) плюс 128-token sliding window. Heavily Compressed Attention (HCA) сжимает в 128 раз, затем запускает dense global attention. Слои чередуют CSA и HCA.
На 1M токенов: V4-Pro использует 27% inference FLOPs V3.2; KV cache падает до 10% памяти V3.2 (Flash: 7%).
Manifold-Constrained Hyper-Connections (mHC) заменяют стандартные residuals 4-канальным потоком под управлением doubly stochastic matrix — стабильные градиенты через 61 слой. Muon (не AdamW) использует Newton-Schulz orthogonalization для более быстрого и стабильного обучения.
| Режим | Use case |
|---|---|
| Non-think | Быстрый routing, классификация, простой Q&A |
| Think High | Отладка, средняя сложность |
| Think Max | Сложная математика, multi-step agents (384K+ context) |
Рекомендуемый sampling: temperature=1.0, top_p=1.0 для всех режимов.
| Бенчмарк | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% open record | 96.0% | N/A | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis Strategy & Ops index: Fable 5 набирает 50 при $3.48/задача; V4-Pro — 38 при $0.03/задача — в 116 раз дешевле при разрыве производительности 24%. V4-Flash остаётся ниже $0.04/задача во всех шести категориях индекса.
| Измерение | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open / self-hostable | Да (MIT) | Нет | Нет |
| 1M context | Да | Не подтверждено | Да |
| Лучший coding (сложные репо) | Второй tier | Второй tier | Лидирует SWE-bench Pro |
| Алгоритмы / математика | Лидер LiveCodeBench | Сильный | — |
| Output (off-peak) | $0.87/M | ~$15/M | ~$50/M |
| Output (peak) | $1.74/M | — | — |
| Суверенитет данных | Self-host возможен | Нет | Нет |
Часы пик (пекинское время): будни 09:00–12:00 и 14:00–18:00 — все тарифы удваиваются.
| Модель | Статья | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | $0.0035/M | 2x |
| Input (cache miss) | $0.435/M | $0.87/M | |
| Output | $0.87/M | $1.74/M | |
| V4-Flash | Input (cache hit) | $0.0028/M | 2x |
| Input (cache miss) | $0.14/M | $0.28/M | |
| Output | $0.28/M | $0.56/M |
Даже в peak output V4-Pro в 8.6 раз дешевле, чем Claude Opus 4.8 ($15/M) и GPT-5.6 Sol (~$15/M).
Советы по экономии: планируйте batch jobs off-peak; максимизируйте prompt cache hits; направляйте простые запросы в V4-Flash; следите за email DeepSeek о смене billing (уведомление за 24 ч).
Дедлайн: 24 июля 2026, 15:59 UTC. Legacy-имена deepseek-chat и deepseek-reasoner будут навсегда отключены.
| Старое имя | Новый эквивалент |
|---|---|
deepseek-chat | deepseek-v4-flash (non-thinking) |
deepseek-reasoner | deepseek-v4-flash (thinking) или deepseek-v4-pro |
Поиск по codebase: grep для deepseek-chat и deepseek-reasoner, включая env vars и CI configs.
Выбор целевой модели: Flash для chat/routing; Pro для тяжёлого reasoning.
Обновление OpenAI SDK: меняется только model; base_url остаётся https://api.deepseek.com.
Включение thinking mode: используйте extra_body с конфигом thinking вместо поведения reasoner.
Тест в staging: проверьте core flows; Think Max требует context window 384K+.
Деплой до дедлайна: пользователи Anthropic SDK меняют только имя модели — тот же base URL.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Solve step by step..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
GA-релиз не обязан обходить Claude Fable 5 на каждом бенчмарке. Он даёт сильнейшую open-weight coding-модель за 1/10–1/100 стоимости closed frontier API.
Self-hosting V4 или запуск long-context agents всё равно требует надёжного железа — ноутбук не держит 24/7, а VM добавляют риски по performance и compliance. Для production iOS CI/CD и AI agent automation аренда Mac Mini в облаке VpsMesh обычно лучший выбор: bare-metal Apple Silicon хорошо сочетается с локальными inference-стеками вроде ds4 + V4 Flash на Mac.
Источники: официальная документация DeepSeek, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.
Будние часы Пекина 09:00–12:00 и 14:00–18:00 удваивают все тарифы. V4-Pro off-peak output — $0.87/M; peak — $1.74/M. См. также цены аренды Mac Mini для сопоставимых затрат на dev-среду.
До 24 июля замените deepseek-chat на deepseek-v4-flash, а deepseek-reasoner — на Flash thinking mode или deepseek-v4-pro. Base URL без изменений.
Pro — флагман 1.6T (49B active); Flash — 284B (13B active). Оба поддерживают 1M context. Flash дешевле ($0.28/M output) для routing; Pro — для сложных agents.
Fable 5 и GPT-5.6 лидируют на самых сложных бенчмарках. V4-Pro под MIT, self-hostable и среди самых дешёвых frontier AI API в 2026 при $0.87/M off-peak output.
V4-Flash можно запустить через движки вроде ds4 на топовых Mac (96GB+ unified memory). Полный Pro требует cluster hardware. Детали настройки — в нашем центре помощи.
Апгрейды agent, math и code; peak-valley pricing; глобальная GA-доступность; legacy model names отключаются 24 июля. Базовая MoE-архитектура без изменений.