DeepSeek V4 정식 출시

피크·밸리 요금 · 100만 토큰 · SWE-bench 80.6% · 7월 24일 마이그레이션

DeepSeek V4 GA 출시 요금 벤치마크 아키텍처 2026년 7월

3개월간의 프리뷰 기간을 거쳐 DeepSeek V4가 2026년 7월 20일 공식 GA(General Availability)에 진입했습니다. DeepSeek V4가 GPT-5.6보다 나은지 궁금하거나 프로덕션에서 여전히 deepseek-chat을 호출하고 있다면, 본 가이드가 필요한 답을 제공합니다. 전체 타임라인, V4-Pro·Flash 아키텍처, 벤치마크 표, 피크·밸리 요금, Claude Fable 5와의 솔직한 비교, 7월 24일 마감 전 6단계 마이그레이션 Runbook을 다룹니다. GA는 Agent·수학·코딩 성능 업그레이드와 시간대별 요금을 함께 가져왔으며, SWE-bench Verified는 80.6%(오픈웨이트 기록)를 기록하고 비피크 출력 단가는 $0.87/M입니다. 데이터 기준: 2026-07-20

01

GA 출시와 4월 프리뷰의 차이점

프리뷰는 2026년 4월 24일 공개되었습니다. 오늘의 GA는 새 아키텍처가 아니라, 프리뷰를 프로덕션 수준의 안정성·최적화·상업 요금 체계로 졸업시킨 것입니다.

날짜마일스톤
2026년 4월 24일프리뷰 + MIT 오픈소스: V4-Pro(1.6T), V4-Flash(284B)
2026년 5월프로덕션 튜닝 버전, API 일반 공개
2026년 6월V4-Pro 출력 요금 영구 75% 인하 → $0.87/M 토큰
2026년 6월 29일전 API 사용자 이메일: 7월 중 GA + 최초 피크·밸리 요금 공개
2026년 7월 19일그레이 릴리스 테스터, 언론 보도로 정식 출시 임박
2026년 7월 20일글로벌 GA 가동
2026년 7월 24일deepseek-chat·deepseek-reasoner 영구 비활성화(15:59 UTC)

현재 개발자가 직면하는 5가지 핵심 과제는 다음과 같습니다.

  1. 01

    레거시 엔드포인트 4일 후 종료: deepseek-chatdeepseek-reasoner는 7월 24일 이후 작동하지 않습니다.

  2. 02

    피크 요금 복잡성: 평일 업무 시간대 요금이 2배 — 24/7 파이프라인은 스케줄링이 필요합니다.

  3. 03

    폐쇄형 모델 비용: Claude Fable 5 출력 ~$50/M, GPT-5.6 Sol ~$15/M — 대규모 운영 시 예산이 빠르게 소진됩니다.

  4. 04

    100만 토큰은 서류상만: 대부분의 모델은 장문 컨텍스트에서 KV 캐시 메모리에 병목이 생깁니다.

  5. 05

    데이터 주권: 폐쇄형 API는 컴플라이언스 민감 워크로드를 셀프호스트할 수 없습니다.

02

아키텍처: DeepSeek이 100만 토큰을 실용화하는 방법

사양V4-ProV4-Flash
총 파라미터1.6조2,840억
토큰당 활성490억(3%)130억(4.6%)
레이어6143
컨텍스트 윈도우1,000,000 토큰1,000,000 토큰
최대 출력384K384K
정밀도FP4(MoE expert) + FP8동일
학습 데이터33T+ 토큰32T+ 토큰
라이선스MITMIT

CSA + HCA 하이브리드 어텐션

V4는 V2/V3의 MLA를 두 트랙 시스템으로 대체했습니다. Compressed Sparse Attention(CSA)은 softmax-gated pooling으로 KV를 4배 압축하고, FP4 라이트닝 인덱서(top-1024 Pro / top-512 Flash)와 128토큰 슬라이딩 윈도우를 사용합니다. Heavily Compressed Attention(HCA)은 128배 압축 후 dense global attention을 수행합니다. 레이어는 CSA와 HCA를 교대로 배치합니다.

100만 토큰 기준: V4-Pro는 V3.2 추론 FLOPs의 27%만 사용하며, KV 캐시는 V3.2 메모리의 10%(Flash: 7%)로 감소합니다.

mHC와 Muon 옵티마이저

Manifold-Constrained Hyper-Connections(mHC)는 표준 residual을 이중 확률 행렬로 제어되는 4채널 스트림으로 대체하여 61개 레이어를 통과해도 그래디언트가 안정적입니다. Muon(AdamW 대신)은 Newton-Schulz 직교화로 더 빠르고 안정적인 학습을 제공합니다.

3가지 추론 모드

모드용도
Non-think빠른 라우팅, 분류, 단순 Q&A
Think High디버깅, 중간 복잡도 작업
Think Max복잡한 수학, 다단계 Agent(384K+ 컨텍스트)

권장 샘플링: 모든 모드에서 temperature=1.0, top_p=1.0을 사용합니다.

03

벤치마크 수치: V4가 이기는 영역과 그렇지 않은 영역

벤치마크V4-ProClaude Fable 5GPT-5.6 UltraOpus 4.8
SWE-bench Verified80.6% 오픈 기록96.0%N/A~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

Artificial Analysis Strategy & Ops 지수: Fable 5는 $3.48/작업에 50점, V4-Pro는 $0.03/작업에 38점 — 성능 격차 24% 대비 116배 저렴합니다. V4-Flash는 6개 지수 카테고리 모두 $0.04/작업 미만을 유지합니다.

04

DeepSeek V4 vs GPT-5.6 vs Claude Fable 5: 솔직한 비교

차원V4-ProGPT-5.6 SolClaude Fable 5
오픈 / 셀프호스트가능(MIT)불가불가
100만 컨텍스트가능미확인가능
최고 난이도 코딩2티어2티어SWE-bench Pro 1위
알고리즘 / 수학LiveCodeBench 1위강력
출력(비피크)$0.87/M~$15/M~$50/M
출력(피크)$1.74/M
데이터 주권셀프호스트 가능불가불가

피크·밸리 요금표

피크 시간(베이징 시간): 평일 09:00–12:00, 14:00–18:00 — 모든 요금 2배 적용.

모델항목비피크피크
V4-Pro입력(캐시 히트)$0.0035/M2x
입력(캐시 미스)$0.435/M$0.87/M
출력$0.87/M$1.74/M
V4-Flash입력(캐시 히트)$0.0028/M2x
입력(캐시 미스)$0.14/M$0.28/M
출력$0.28/M$0.56/M

피크 시간에도 V4-Pro 출력은 Claude Opus 4.8($15/M) 및 GPT-5.6 Sol(~$15/M) 대비 8.6배 저렴합니다.

비용 절감 팁: 배치 작업은 비피크 시간대에 스케줄링하고, 프롬프트 캐시 히트를 극대화하며, 단순 쿼리는 V4-Flash로 라우팅하세요. DeepSeek 요금 변경 이메일(24시간 전 공지)을 모니터링합니다.

05

마이그레이션 Runbook: 7월 24일 전 6단계

마감: 2026년 7월 24일 15:59 UTC. 레거시 모델명 deepseek-chatdeepseek-reasoner는 영구 비활성화됩니다.

기존 이름신규 대응
deepseek-chatdeepseek-v4-flash(non-thinking)
deepseek-reasonerdeepseek-v4-flash(thinking) 또는 deepseek-v4-pro
  1. 01

    코드베이스 검색: 환경 변수와 CI 설정을 포함해 deepseek-chatdeepseek-reasoner를 grep으로 찾습니다.

  2. 02

    대상 모델 선택: 채팅·라우팅은 Flash, 고난도 추론은 Pro를 사용합니다.

  3. 03

    OpenAI SDK 업데이트: model만 변경하고 base_urlhttps://api.deepseek.com 그대로 유지합니다.

  4. 04

    thinking 모드 활성화: extra_bodythinking 설정을 넣어 reasoner 동작을 대체합니다.

  5. 05

    스테이징 테스트: 핵심 플로우를 검증하고, Think Max는 384K+ 컨텍스트 윈도우가 필요합니다.

  6. 06

    마감 전 배포: Anthropic SDK 사용자는 모델명만 교체하면 되며 base URL은 동일합니다.

python
response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Solve step by step..."}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

인용할 핵심 수치

  • SWE-bench Verified: 80.6% — 최고 오픈웨이트 점수
  • KV 캐시: 100만 토큰에서 V3.2 메모리의 10%
  • 비용 비율: Fable 5 대비 $0.03 vs $3.48/작업
  • 피크 출력: $1.74/M — 폐쇄형 프론티어 API 대비 8.6배 저렴
  • 마이그레이션 마감: 2026년 7월 24일 15:59 UTC

GA 출시가 Claude Fable 5를 모든 벤치마크에서 이길 필요는 없습니다. 폐쇄형 프론티어 API 대비 1/10~1/100 비용으로 가장 강력한 오픈웨이트 코딩 모델을 제공합니다.

V4 셀프호스트나 장문 Agent 운영에는 안정적인 하드웨어가 필요합니다. 노트북은 24/7 가동이 어렵고 일반 VM은 성능·컴플라이언스 리스크가 있습니다. 프로덕션 iOS CI/CD와 AI Agent 자동화에는 VpsMesh Mac Mini 클라우드 임대가 일반적으로 더 적합합니다. 베어메탈 Apple Silicon은 ds4 + V4 Flash Mac 로컬 추론 스택과 잘 맞습니다.

출처: DeepSeek 공식 문서, arXiv:2606.19348, HuggingFace, LLMReference, Artificial Analysis, MangoMind Blog, TechNode.

FAQ

자주 묻는 질문

평일 베이징 시간 09:00–12:00, 14:00–18:00에는 모든 요금이 2배입니다. V4-Pro 비피크 출력은 $0.87/M, 피크는 $1.74/M입니다. 개발 환경 비용은 Mac Mini M4 클라우드 임대 요금도 함께 참고하세요.

7월 24일 이전에 deepseek-chatdeepseek-v4-flash로, deepseek-reasoner를 Flash thinking 모드 또는 deepseek-v4-pro로 교체하세요. base URL은 변경하지 않습니다.

Pro는 1.6T 플래그십(490억 활성), Flash는 284B(130억 활성)입니다. 둘 다 100만 토큰을 지원합니다. 라우팅에는 Flash($0.28/M 출력)가 저렴하고, 복잡한 Agent에는 Pro를 사용합니다.

Fable 5와 GPT-5.6이 최고 난이도 벤치마크에서 앞섭니다. V4-Pro는 MIT 라이선스, 셀프호스트 가능하며 비피크 출력 $0.87/M로 2026년 가장 저렴한 프론티어 AI API 중 하나입니다.

V4-Flash는 ds4 등 엔진으로 고사양 Mac(96GB+ 통합 메모리)에서 실행 가능합니다. Pro 전체는 클러스터급 하드웨어가 필요합니다. 설정은 고객 센터를 참고하세요.

Agent·수학·코딩 성능 업그레이드, 피크·밸리 요금, 글로벌 GA 가용성, 7월 24일 레거시 모델명 폐기가 포함됩니다. 기본 MoE 아키텍처는 동일합니다.