0731 post-training · Harness · сравнение конкурентов · оговорки по бенчмаркам · сроки V4-Pro
31 июля 2026 года DeepSeek перевёл V4-Flash-0731 в официальную public API-сборку: та же архитектура 284B / 13B active, что в апрельском preview, прирост полностью от повторного post-training. На agent-бенчмарках модель обходит более крупный V4-Pro preview при цене примерно в 1/36–1/179 от Claude Opus 4.8. Если вы оцениваете достоверность бенчмарков, сравниваете с Kimi K3 или Qwen3.8-Max или мигрируете с устаревших alias deepseek-chat, здесь — хронология релиза, таблица цен, разбор Harness, сравнение конкурентов, шестишаговый runbook и оговорки по бенчмаркам. Данные на 2026-08-05.
Фраза «официальная версия DeepSeek V4» легко читается как новая модель. Это не так: та же 284B-архитектура с повторным post-training. Флагманский официальный V4-Pro и первый in-house agent framework Harness по-прежнему не выпущены, без подтверждённой даты.
24 апреля 2026: preview DeepSeek-V4 с двумя open-weight MoE (MIT) — V4-Pro (1.6T / 49B active) и V4-Flash (284B / 13B active), оба с контекстом 1M токенов. См. разбор GA DeepSeek V4.
24 июля 2026: legacy alias deepseek-chat и deepseek-reasoner отключены; весь трафик идёт на семейство V4.
27 июля 2026: Moonshot AI публикует open weights Kimi K3 (2.8T total params), усиливая давление за несколько дней до обновления DeepSeek. См. гайд по Kimi K3.
31 июля 2026: V4-Flash-0731 переведён в official public API beta; open weights на Hugging Face в тот же день. Changelog впервые называет DeepSeek Harness — «to be released soon». Критично: обновление только API — consumer app и web chat не затронуты.
2 августа 2026: API Qwen3.8-Max от Alibaba выходит в GA; weights ещё не опубликованы. См. разбор Qwen3.8-Max.
На 5 августа 2026: официальный V4-Pro не подтверждён. Китайские СМИ со ссылкой на безымянные источники пишут о внутреннем тестировании с 28 июля и возможном GA 10–20 августа — окно не подтверждено DeepSeek и должно считаться слухом.
При отслеживании релиза команды часто упираются в пять слепых зон:
«Официальная версия» ≠ новая модель: архитектура и число параметров идентичны апрельскому preview — прирост только от post-training.
Зависимость бенчмарков от harness: agent-оценки сняты на неопубликованном «minimal mode» Harness, а не на сторонних agent tools.
API-only: consumer app и web chat не обновлены до сборки 0731.
Пробел V4-Pro: официальный флагман недоступен; для сложного reasoning может понадобиться preview.
Слухи о финансировании: сообщения о раунде ~$7.4B и оценке ~$48.7B идут из финансовых СМИ без подтверждения DeepSeek или регуляторных filings.
| Модель | Статус | Total / active params | Контекст | Input (miss / hit, $/M) | Output ($/M) | Лицензия |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Official (31.07.2026) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | Только preview (24.04.2026) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Open weights (27.07.2026) | 2.8T / ~104B (оценка сообщества) | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | Open (июнь 2026) | ~744B / ~40B | 1M | Не проверено | Не проверено | MIT |
| Qwen3.8-Max | API GA (02.08.2026); weights pending | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | Open weights обещаны |
Все цены — vendor-published rates. DeepSeek анонсировал будущую 2× наценку в peak hours (09:00–12:00 и 14:00–18:00 по Пекину) без подтверждённой даты. Относительно Claude Opus 4.8: cache-miss input примерно в 36 раз дешевле, cache-hit input около 179 раз, output около 89 раз за миллион токенов (по 21st Century Business Herald со ссылкой на официальные тарифы).
V4-Flash-0731 идентичен по размеру и структуре апрельскому preview. DeepSeek заявляет, что весь скачок на agent-бенчмарках — от повторного post-training, а не от масштабирования. Это противоречит интуиции «больше = лучше»: модель 284B/13B обходит 1.6T/49B из того же семейства на нескольких agentic задачах, что подчёркивает роль качества post-training в конкуренции второй половины 2026 года.
Техотчёт «DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence» описывает три архитектурных изменения из апрельского preview:
Hybrid attention (DSA): Compressed Sparse Attention (CSA) и Heavily Compressed Attention (HCA) снижают compute и memory на длинном контексте.
Manifold-Constrained Hyper-Connections (mHC): улучшение стандартных residual connections.
Оптимизатор Muon: более быстрая сходимость и стабильность обучения.
DeepSeek заявляет: при контексте 1M токенов V4-Pro требует лишь 27% per-token inference FLOPs и 10% KV cache footprint относительно V3.2. Это vendor-reported метрики; независимого воспроизведения пока нет.
31 июля — первое официальное упоминание DeepSeek Harness: in-house agent execution framework для file I/O, tool calls и многошаговых инженерных задач — ответ DeepSeek на Claude Code, которым команды пользовались до сих пор. Каждый agent-бенчмарк для V4-Flash-0731 (Terminal Bench 2.0, Toolathlon и др.) снят в «minimal mode» Harness, который ещё не опубликован, при max reasoning effort, top_p 0.95, temperature 1.0. Changelog предупреждает, что agent scores «extremely sensitive to harness choice» — это стоит принять буквально.
| Модель | Lab | Intelligence Index (Artificial Analysis) | Средняя стоимость задачи | Официальные agent-оценки DeepSeek |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 | Terminal Bench 2.0: 82.7 (Harness minimal mode) |
| Kimi K3 | Moonshot AI | 57 | $0.86 | — |
| GLM-5.2 | Zhipu / Z.ai | ~1 пункт выше V4-Flash | Не проверено | — |
| GPT-5.6 Sol | OpenAI | 9+ пунктов выше V4-Flash | $1.86 | Closed source |
| Claude Fable 5 | Anthropic | 9+ пунктов выше V4-Flash | $3.15 | Closed source |
DeepSeek не борется за вершину leaderboard — стратегия «достаточный интеллект по цене, которую другие не повторят». Стоимость задачи — примерно 1/29 от Kimi K3 и 1/105 от Claude Fable 5.
Оговорки по бенчмаркам: 1) Terminal Bench 2.0 — 82.7 (vs 67.9 у V4-Pro preview) на неопубликованном Harness minimal mode при max settings; 2) зарубежные разработчики сообщают о низком cache-hit rate и timeout safety classifier; 3) даты V4-Pro / Harness — неподтверждённые слухи СМИ; 4) отчёты о финансировании и IPO — без официальных filings.
V4-Flash-0731 поддерживает OpenAI- и Anthropic-compatible API и встраивается в Claude Code, OpenCode, Cursor и другие agent toolchains. Шесть шагов от оценки до production:
Аудит legacy-вызовов: найти в коде deepseek-chat / deepseek-reasoner, зафиксировать месячный объём и baseline cache-hit rate.
Смена model naming: deepseek-chat → deepseek-v4-flash (non-thinking); deepseek-reasoner → Flash thinking mode или preview deepseek-v4-pro. Base URL без изменений.
Стратегия cache: мониторить input cache-hit — сообщество отмечает более низкий hit rate у official build, что бьёт по счёту; сначала протестировать Prompt Caching на long-context.
A/B с конкурентами: прогнать свои samples через Kimi K3 ($3/$15), Qwen3.8-Max ($2/$6) и V4-Flash ($0.14/$0.28) по latency, success rate и cost per task.
Agent host environment: Harness пока не public — в production использовать Claude Code или OpenCode; после GA Harness перепроверить Terminal Bench–class задачи.
Primary/backup routing и мониторинг: batch через V4-Flash; сложный reasoning — V4-Pro preview или Claude как fallback; cost caps и алерты на peak-hour 2× surcharge.
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Analyze this code..."}]
)
Чистые API-вызовы закрывают agent inference V4-Flash, но iOS signing chains, локальные Xcode builds, Metal workloads и 7×24 agent long-runs требуют реальных macOS-узлов — ноутбук не держит persistent OpenClaw / Claude Code agents, VM даёт performance tax и EULA risk. Для production iOS CI/CD и AI agent automation облачная аренда Mac Mini VpsMesh обычно лучше: bare-metal Apple Silicon, root access и предсказуемый monthly cost в паре с DeepSeek API в архитектуре «cloud inference + local build». Локальный inference: гайд ds4 + V4 Flash; тарифы — цены аренды Mac Mini M4.
Источники: официальная документация и changelog DeepSeek · технический отчёт · Artificial Analysis · 21st Century Business Herald · Kuai Technology · обсуждение V2EX. Перед production сверьте актуальные цены, бенчмарки и статус V4-Pro/Harness.
Да. V4-Pro и V4-Flash, включая официальную сборку V4-Flash-0731 от 31 июля, публикуются как open weights под MIT на Hugging Face и могут использоваться, дообучаться и распространяться коммерчески без дополнительных разрешений.
По данным 21st Century Business Herald, официальный V4-Flash примерно в 36 раз дешевле Claude Opus 4.8 на cache-miss input, около 179 раз на cache-hit input и около 89 раз на output за миллион токенов. Это vendor list prices, не независимый аудит.
Подтверждённой даты нет. Changelog DeepSeek говорит только, что официальный V4-Pro «will follow as soon as possible». Окно GA 10–20 августа из китайских СМИ не подтверждено. Для agent host deployment см. цены аренды Mac Mini M4.
Частично. SWE-bench Verified и другие прозрачные сторонние бенчмарки весят больше. Agent-оценки (Terminal Bench 2.0, Toolathlon и др.) сняты на неопубликованном Harness, и компания предупреждает о высокой чувствительности к выбору harness — дождитесь independent reproduction через Claude Code, Cursor и другие agent tools.
Первый собственный agent execution framework DeepSeek — in-house альтернатива Claude Code для редактирования файлов, tool calls и многошаговых инженерных задач. Впервые назван в changelog от 31.07.2026 и пока недоступен публично.
При доступе к DeepSeek через OpenAI- или Anthropic-format API код менять не нужно — deepseek-v4-flash автоматически указывает на новую official build. Если ещё вызываете отключённые deepseek-chat / deepseek-reasoner, переключитесь немедленно. Подробности развёртывания — в центре помощи.