피크·밸리 요금 · 100만 토큰 · SWE-bench 80.6% · 7월 24일 마이그레이션
3개월간의 프리뷰 기간을 거쳐 DeepSeek V4가 2026년 7월 20일 공식 GA(General Availability)에 진입했습니다. DeepSeek V4가 GPT-5.6보다 나은지 궁금하거나 프로덕션에서 여전히 deepseek-chat을 호출하고 있다면, 본 가이드가 필요한 답을 제공합니다. 전체 타임라인, V4-Pro·Flash 아키텍처, 벤치마크 표, 피크·밸리 요금, Claude Fable 5와의 솔직한 비교, 7월 24일 마감 전 6단계 마이그레이션 Runbook을 다룹니다. GA는 Agent·수학·코딩 성능 업그레이드와 시간대별 요금을 함께 가져왔으며, SWE-bench Verified는 80.6%(오픈웨이트 기록)를 기록하고 비피크 출력 단가는 $0.87/M입니다. 데이터 기준: 2026-07-20
프리뷰는 2026년 4월 24일 공개되었습니다. 오늘의 GA는 새 아키텍처가 아니라, 프리뷰를 프로덕션 수준의 안정성·최적화·상업 요금 체계로 졸업시킨 것입니다.
| 날짜 | 마일스톤 |
|---|---|
| 2026년 4월 24일 | 프리뷰 + MIT 오픈소스: V4-Pro(1.6T), V4-Flash(284B) |
| 2026년 5월 | 프로덕션 튜닝 버전, API 일반 공개 |
| 2026년 6월 | V4-Pro 출력 요금 영구 75% 인하 → $0.87/M 토큰 |
| 2026년 6월 29일 | 전 API 사용자 이메일: 7월 중 GA + 최초 피크·밸리 요금 공개 |
| 2026년 7월 19일 | 그레이 릴리스 테스터, 언론 보도로 정식 출시 임박 |
| 2026년 7월 20일 | 글로벌 GA 가동 |
| 2026년 7월 24일 | deepseek-chat·deepseek-reasoner 영구 비활성화(15:59 UTC) |
현재 개발자가 직면하는 5가지 핵심 과제는 다음과 같습니다.
레거시 엔드포인트 4일 후 종료: deepseek-chat과 deepseek-reasoner는 7월 24일 이후 작동하지 않습니다.
피크 요금 복잡성: 평일 업무 시간대 요금이 2배 — 24/7 파이프라인은 스케줄링이 필요합니다.
폐쇄형 모델 비용: Claude Fable 5 출력 ~$50/M, GPT-5.6 Sol ~$15/M — 대규모 운영 시 예산이 빠르게 소진됩니다.
100만 토큰은 서류상만: 대부분의 모델은 장문 컨텍스트에서 KV 캐시 메모리에 병목이 생깁니다.
데이터 주권: 폐쇄형 API는 컴플라이언스 민감 워크로드를 셀프호스트할 수 없습니다.
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조 | 2,840억 |
| 토큰당 활성 | 490억(3%) | 130억(4.6%) |
| 레이어 | 61 | 43 |
| 컨텍스트 윈도우 | 1,000,000 토큰 | 1,000,000 토큰 |
| 최대 출력 | 384K | 384K |
| 정밀도 | FP4(MoE expert) + FP8 | 동일 |
| 학습 데이터 | 33T+ 토큰 | 32T+ 토큰 |
| 라이선스 | MIT | MIT |
V4는 V2/V3의 MLA를 두 트랙 시스템으로 대체했습니다. Compressed Sparse Attention(CSA)은 softmax-gated pooling으로 KV를 4배 압축하고, FP4 라이트닝 인덱서(top-1024 Pro / top-512 Flash)와 128토큰 슬라이딩 윈도우를 사용합니다. Heavily Compressed Attention(HCA)은 128배 압축 후 dense global attention을 수행합니다. 레이어는 CSA와 HCA를 교대로 배치합니다.
100만 토큰 기준: V4-Pro는 V3.2 추론 FLOPs의 27%만 사용하며, KV 캐시는 V3.2 메모리의 10%(Flash: 7%)로 감소합니다.
Manifold-Constrained Hyper-Connections(mHC)는 표준 residual을 이중 확률 행렬로 제어되는 4채널 스트림으로 대체하여 61개 레이어를 통과해도 그래디언트가 안정적입니다. Muon(AdamW 대신)은 Newton-Schulz 직교화로 더 빠르고 안정적인 학습을 제공합니다.
| 모드 | 용도 |
|---|---|
| Non-think | 빠른 라우팅, 분류, 단순 Q&A |
| Think High | 디버깅, 중간 복잡도 작업 |
| Think Max | 복잡한 수학, 다단계 Agent(384K+ 컨텍스트) |
권장 샘플링: 모든 모드에서 temperature=1.0, top_p=1.0을 사용합니다.
| 벤치마크 | V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% 오픈 기록 | 96.0% | N/A | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis Strategy & Ops 지수: Fable 5는 $3.48/작업에 50점, V4-Pro는 $0.03/작업에 38점 — 성능 격차 24% 대비 116배 저렴합니다. V4-Flash는 6개 지수 카테고리 모두 $0.04/작업 미만을 유지합니다.
| 차원 | V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈 / 셀프호스트 | 가능(MIT) | 불가 | 불가 |
| 100만 컨텍스트 | 가능 | 미확인 | 가능 |
| 최고 난이도 코딩 | 2티어 | 2티어 | SWE-bench Pro 1위 |
| 알고리즘 / 수학 | LiveCodeBench 1위 | 강력 | — |
| 출력(비피크) | $0.87/M | ~$15/M | ~$50/M |
| 출력(피크) | $1.74/M | — | — |
| 데이터 주권 | 셀프호스트 가능 | 불가 | 불가 |
피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00 — 모든 요금 2배 적용.
| 모델 | 항목 | 비피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | $0.0035/M | 2x |
| 입력(캐시 미스) | $0.435/M | $0.87/M | |
| 출력 | $0.87/M | $1.74/M | |
| V4-Flash | 입력(캐시 히트) | $0.0028/M | 2x |
| 입력(캐시 미스) | $0.14/M | $0.28/M | |
| 출력 | $0.28/M | $0.56/M |
피크 시간에도 V4-Pro 출력은 Claude Opus 4.8($15/M) 및 GPT-5.6 Sol(~$15/M) 대비 8.6배 저렴합니다.
비용 절감 팁: 배치 작업은 비피크 시간대에 스케줄링하고, 프롬프트 캐시 히트를 극대화하며, 단순 쿼리는 V4-Flash로 라우팅하세요. DeepSeek 요금 변경 이메일(24시간 전 공지)을 모니터링합니다.
마감: 2026년 7월 24일 15:59 UTC. 레거시 모델명 deepseek-chat과 deepseek-reasoner는 영구 비활성화됩니다.
| 기존 이름 | 신규 대응 |
|---|---|
deepseek-chat | deepseek-v4-flash(non-thinking) |
deepseek-reasoner | deepseek-v4-flash(thinking) 또는 deepseek-v4-pro |
코드베이스 검색: 환경 변수와 CI 설정을 포함해 deepseek-chat과 deepseek-reasoner를 grep으로 찾습니다.
대상 모델 선택: 채팅·라우팅은 Flash, 고난도 추론은 Pro를 사용합니다.
OpenAI SDK 업데이트: model만 변경하고 base_url은 https://api.deepseek.com 그대로 유지합니다.
thinking 모드 활성화: extra_body에 thinking 설정을 넣어 reasoner 동작을 대체합니다.
스테이징 테스트: 핵심 플로우를 검증하고, Think Max는 384K+ 컨텍스트 윈도우가 필요합니다.
마감 전 배포: Anthropic SDK 사용자는 모델명만 교체하면 되며 base URL은 동일합니다.
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Solve step by step..."}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
GA 출시가 Claude Fable 5를 모든 벤치마크에서 이길 필요는 없습니다. 폐쇄형 프론티어 API 대비 1/10~1/100 비용으로 가장 강력한 오픈웨이트 코딩 모델을 제공합니다.
V4 셀프호스트나 장문 Agent 운영에는 안정적인 하드웨어가 필요합니다. 노트북은 24/7 가동이 어렵고 일반 VM은 성능·컴플라이언스 리스크가 있습니다. 프로덕션 iOS CI/CD와 AI Agent 자동화에는 VpsMesh Mac Mini 클라우드 임대가 일반적으로 더 적합합니다. 베어메탈 Apple Silicon은 ds4 + V4 Flash Mac 로컬 추론 스택과 잘 맞습니다.
출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.
평일 베이징 시간 09:00–12:00, 14:00–18:00에는 모든 요금이 2배입니다. V4-Pro 비피크 출력은 $0.87/M, 피크는 $1.74/M입니다. 개발 환경 비용은 Mac Mini M4 클라우드 임대 요금도 함께 참고하세요.
7월 24일 이전에 deepseek-chat을 deepseek-v4-flash로, deepseek-reasoner를 Flash thinking 모드 또는 deepseek-v4-pro로 교체하세요. base URL은 변경하지 않습니다.
Pro는 1.6T 플래그십(490억 활성), Flash는 284B(130억 활성)입니다. 둘 다 100만 토큰을 지원합니다. 라우팅에는 Flash($0.28/M 출력)가 저렴하고, 복잡한 Agent에는 Pro를 사용합니다.
Fable 5와 GPT-5.6이 최고 난이도 벤치마크에서 앞섭니다. V4-Pro는 MIT 라이선스, 셀프호스트 가능하며 비피크 출력 $0.87/M로 2026년 가장 저렴한 프론티어 AI API 중 하나입니다.
V4-Flash는 ds4 등 엔진으로 고사양 Mac(96GB+ 통합 메모리)에서 실행 가능합니다. Pro 전체는 클러스터급 하드웨어가 필요합니다. 설정은 고객 센터를 참고하세요.
Agent·수학·코딩 성능 업그레이드, 피크·밸리 요금, 글로벌 GA 가용성, 7월 24일 레거시 모델명 폐기가 포함됩니다. 기본 MoE 아키텍처는 동일합니다.