DeepSeek V4-Flash가 정말 Claude보다 100배 저렴한가?

0731 후학습 업그레이드 · Harness 프레임워크 · 경쟁사 비교 · 벤치마크 주의 · V4-Pro 일정

DeepSeek V4 Flash 공식 출시 벤치마크 및 API 요금 비교

2026년 7월 31일, DeepSeekV4-Flash-0731을 공식 공개 API 빌드로 승격했습니다. 4월 프리뷰와 동일한 284B / 13B 활성 아키텍처이며, 성능 향상은 전적으로 새 후학습 패스에서 나왔습니다. 현재 DeepSeek 자체 더 큰 V4-Pro 프리뷰를 Agent 벤치마크에서 능가하며, Claude Opus 4.8 요금의 약 1/36~1/179 수준입니다. 벤치마크 신뢰도, Kimi K3·Qwen3.8-Max와의 비교, 폐기된 deepseek-chat 별칭 마이그레이션이 필요하다면 본문의 출시 타임라인, 핵심 요금표, Harness 분석, 경쟁사 비교, 6단계 API Runbook, 벤치마크 주의사항을 참고하세요. 데이터 기준: 2026-08-05.

01

7월 31일 실제로 출시된 것과 아직 아닌 것

「DeepSeek V4 공식판」이라는 표현만 보면 새 모델이 나온 것처럼 읽히기 쉽습니다. 실제로는 그렇지 않습니다. 동일한 284B 파라미터 아키텍처에 후학습을 다시 돌린 업데이트입니다. 플래그십 V4-Pro 공식판과 DeepSeek 최초 자체 Agent 프레임워크 Harness는 아직 미출시이며 확정 일정도 없습니다.

  1. 01

    2026년 4월 24일: DeepSeek-V4 프리뷰 출시. MIT 오픈 웨이트 MoE 두 종 — V4-Pro(1.6T / 49B 활성), V4-Flash(284B / 13B 활성) — 모두 100만 토큰 컨텍스트. V4 GA 해부 참고.

  2. 02

    2026년 7월 24일: 레거시 별칭 deepseek-chat·deepseek-reasoner 폐기, 전 트래픽 V4 계열로 전환.

  3. 03

    2026년 7월 27일: Moonshot AI가 Kimi K3(2.8T 총 파라미터) 전체 오픈 웨이트 공개, DeepSeek 업데이트 직전 경쟁 압박. Kimi K3 오픈웨이트 가이드 참고.

  4. 04

    2026년 7월 31일: V4-Flash-0731 공식 공개 API 베타 진입, 당일 Hugging Face 오픈 웨이트 동시 공개. Changelog에서 DeepSeek Harness를 처음 언급하며 「곧 출시」 예고. 이번 업데이트는 API 전용이며 소비자 앱·웹 채팅은 미반영.

  5. 05

    2026년 8월 2일: Alibaba Qwen3.8-Max API GA, 가중치는 대기. Qwen3.8-Max 오픈소스 분석 참고.

  6. 06

    2026년 8월 5일 기준: V4-Pro 공식판은 미확정. 일부 중국 매체가 무기명 출처로 7월 28일 주 내부 테스트·8월 10–20일 GA 창을 보도했으나 DeepSeek 미확인 소문으로 취급해야 합니다.

이번 출시를 추적하는 팀이 자주 놓치는 다섯 가지 블라인드 스팟은 다음과 같습니다.

  1. 01

    「공식판」 오독: 아키텍처·파라미터 수는 4월 프리뷰와 동일하며, 성능은 전적으로 후학습에서 나왔습니다.

  2. 02

    벤치마크 프레임워크 의존: Agent 점수는 미공개 Harness 「minimal mode」로 측정되었으며 서드파티 Agent 도구가 아닙니다.

  3. 03

    API 전용 제한: 소비자 앱·웹 채팅은 0731 빌드로 갱신되지 않았습니다.

  4. 04

    Pro 공백: 플래그십 V4-Pro 공식판 미출시, 복잡한 추론은 프리뷰 빌드가 필요할 수 있습니다.

  5. 05

    투자 소문: 약 74억 달러 라운드·약 487억 달러 밸류에이션 보도는 무기명 금융매체 출처이며 DeepSeek·규제 공시 미확인입니다.

02

핵심 수치: 요금, 파라미터, 라이선스

모델상태총/활성 파라미터컨텍스트입력(미스/히트, $/M)출력($/M)라이선스
DeepSeek-V4-Flash-0731공식(2026-07-31)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-Pro프리뷰만(2026-04-24)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3오픈 웨이트(2026-07-27)2.8T / ~104B(커뮤니티 추정)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2오픈(2026년 6월)~744B / ~40B1M미검증미검증MIT
Qwen3.8-MaxAPI GA(2026-08-02), 가중치 대기2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00오픈 웨이트 예고

참고: 위 요금은 모두 벤더 공시 요율입니다. DeepSeek는 향후 피크 시간(베이징 9–12시·14–18시) 2배 할증을 예고했으나 시행일은 미확정입니다. Claude Opus 4.8 대비: 캐시 미스 입력 약 36배, 캐시 히트 입력 약 179배, 출력 약 89배 저렴(21세기경제보도 공식 요금 인용, 백만 토큰당).

03

후학습 업그레이드와 Harness: 성능의 원천

아키텍처는 그대로, 학습 데이터가 바뀌었습니다

V4-Flash-0731은 4월 프리뷰와 규모·구조가 동일합니다. DeepSeek는 Agent 벤치마크 성능 향상이 스케일업이 아닌 후학습 재실행에서 전부 나왔다고 명시합니다. 이는 업계 기본 가정인 「더 크면 더 좋다」와 정면으로 다릅니다. 284B/13B 모델이 동일 계열 1.6T/49B 모델을 여러 Agent 작업에서 능가하며, 2026년 하반기 경쟁에서 후학습 품질이 순수 파라미터 수에 필적하고 있음을 보여줍니다.

하이브리드 어텐션: CSA + HCA, mHC, Muon 옵티마이저

DeepSeek 기술 보고서(「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」)는 4월 프리뷰에서 이어진 세 가지 아키텍처 변경을 설명합니다.

  1. 01

    하이브리드 어텐션(DSA): Compressed Sparse Attention(CSA)과 Heavily Compressed Attention(HCA)을 결합해 장문 컨텍스트에서 연산·메모리 비용을 절감합니다.

  2. 02

    Manifold-Constrained Hyper-Connections(mHC): 표준 잔차 연결을 개선한 구조입니다.

  3. 03

    Muon 옵티마이저: 수렴 속도와 학습 안정성 향상에 사용됩니다.

DeepSeek는 100만 토큰 컨텍스트에서 V4-Pro가 V3.2 대비 토큰당 추론 FLOPs 27%, KV 캐시 10%만 필요하다고 주장합니다. 벤더 자체 효율 수치이며 독립 서드파티 재현은 아직 공개되지 않았습니다.

Harness: DeepSeek 최초 자체 Agent 프레임워크

7월 31일 DeepSeek Harness가 처음 공식 언급되었습니다. 파일 I/O, 도구 호출, 다단계 엔지니어링 작업용 자체 Agent 실행 프레임워크로 Claude Code 대안으로 포지셔닝됩니다. V4-Flash-0731 Agent 벤치마크(Terminal Bench 2.0, Toolathlon 등)는 모두 아직 공개되지 않은 Harness 「minimal mode」에서 max reasoning effort, top_p 0.95, temperature 1.0으로 측정되었습니다. Changelog에서도 Agent 점수가 「harness 선택에 극도로 민감」하다고 경고합니다.

04

경쟁사 비교와 벤치마크 주의: 중국 오픈웨이트 「육각 전쟁」

모델Intelligence Index(Artificial Analysis)작업당 평균 비용DeepSeek 공식 Agent 점수
V4-Flash-0731DeepSeek50$0.03Terminal Bench 2.0: 82.7(Harness minimal mode)
Kimi K3Moonshot AI57$0.86
GLM-5.2Zhipu / Z.aiV4-Flash 대비 약 1점 상회미검증
GPT-5.6 SolOpenAIV4-Flash 대비 9점 이상 상회$1.86폐쇄형
Claude Fable 5AnthropicV4-Flash 대비 9점 이상 상회$3.15폐쇄형

DeepSeek는 리더보드 1위가 아니라 「충분한 지능 + 아무도 따라올 수 없는 가격」을 최적화합니다. 작업당 비용은 Kimi K3의 약 1/29, Claude Fable 5의 약 1/105 수준입니다.

주의: ① Terminal Bench 2.0 82.7점(V4-Pro 프리뷰 67.9점)은 미공개 Harness minimal mode max 설정 측정; ② 해외 개발자는 입력 캐시 히트율 저하·안전 분류기 타임아웃 보고; ③ V4-Pro·Harness 출시일은 미확인 매체 소문; ④ 투자·IPO 보도는 무기명 출처이며 공식 공시 아님.

05

6단계 API 선정 Runbook: 마이그레이션부터 프로덕션 라우팅까지

V4-Flash-0731은 OpenAI·Anthropic 호환 API를 지원하며 Claude Code, OpenCode, Cursor 등 Agent 툴체인에 바로 연결됩니다. 평가에서 프로덕션까지 6단계 경로는 다음과 같습니다.

  1. 01

    레거시 호출 감사: 폐기된 deepseek-chat / deepseek-reasoner 별칭을 코드에서 스캔하고 월간 호출량·캐시 히트율 기준선을 잡습니다.

  2. 02

    모델명 전환: deepseek-chatdeepseek-v4-flash(non-thinking), deepseek-reasoner → Flash thinking 모드 또는 deepseek-v4-pro 프리뷰. base URL은 동일합니다.

  3. 03

    캐시 전략 평가: 입력 캐시 히트율을 모니터링합니다. 해외 커뮤니티 피드백상 공식 빌드는 예상보다 캐시 히트가 적을 수 있어 청구에 직접 영향합니다. 장문 워크로드에서 Prompt Caching을 먼저 테스트하세요.

  4. 04

    경쟁사 A/B: Kimi K3($3/$15), Qwen3.8-Max($2/$6), V4-Flash($0.14/$0.28)로 자체 샘플을 돌려 지연·성공률·작업당 비용을 비교합니다.

  5. 05

    Agent 호스트 환경 구성: Harness는 미공개 — 프로덕션에서는 Claude Code 또는 OpenCode를 실행 프레임워크로 사용하고, Harness GA 이후 Terminal Bench급 작업을 재테스트합니다.

  6. 06

    주·백업 라우팅과 모니터링: 대량 배치는 V4-Flash, 복잡 추론은 V4-Pro 프리뷰 또는 Claude 백업, 비용 상한·피크 2배 할증 알림을 설정합니다.

python
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Analyze this code..."}]
)
06

업계 맥락, 핵심 수치, VpsMesh가 맞는 지점

  • 「斩杀线(kill line)」 효과: 중국 개발자 커뮤니티는 DeepSeek의 「충분한 성능 + 극저가」 조합이 경쟁사에 넘어야 할 문턱을 만든다고 봅니다. 이 프레이밍은 같은 시기 OpenAI GPT-5.6 Luna 80% 인하 같은 움직임을 설명하는 데 도움이 됩니다.
  • 커뮤니티 정서 반전: V4-Flash-0731 출시 전 포럼은 V4-Pro 지연으로 창업자 양원봉을 「梁白开(공약 공허)」로 놀렸으나, Flash 빌드가 기대를 넘자 「梁圣(현인)」으로 되돌아갔습니다. 중국 AI 개발자 정서가 얼마나 빠르게 바뀌는지 보여주는 지표입니다.
  • 칩주 반응은 옅음: 7월 31일 V4-Flash 공식화 당일 Nvidia·Broadcom·AMD는 뚜렷한 변동이 없었습니다. 2025년 초 DeepSeek-R1 효율 주장이 글로벌 AI 칩 매도를 촉발했던 것과 대비됩니다. 시장은 「적은 연산으로 더 많이」를 일상적 엔지니어링으로 받아들이는 단계입니다.
  • OpenRouter 호출량: V4-Flash 프리뷰가 7주 연속 OpenRouter 최다 사용 모델 1위를 기록했다는 보도가 있습니다. 대규모 저비용 Agent 호출이 핵심 사용자층임을 시사합니다.
  • Terminal Bench 2.0: 공식 82.7점 vs V4-Pro 프리뷰 67.9점 — 미공개 Harness 측정이므로 독립 재현 전까지는 벤더 보고로 취급해야 합니다.

순수 API 호출은 V4-Flash Agent 추론을 커버하지만, iOS 서명 체인, Xcode 로컬 빌드, Metal 워크로드, 24/7 Agent 장기 실행에는 실제 macOS 노드가 필요합니다. 노트북은 지속 OpenClaw / Claude Code Agent 호스팅에 한계가 있고 VM은 성능 세금과 EULA 리스크가 있습니다. 프로덕션 iOS CI/CD와 AI Agent 자동화에는 VpsMesh Mac Mini 클라우드 임대가 일반적으로 더 적합합니다. 베어메탈 Apple Silicon, root 접근, 예측 가능한 월 비용이 DeepSeek API와 클라우드 추론+로컬 빌드 아키텍처에 잘 맞습니다. 로컬 추론 옵션: ds4 + V4 Flash 로컬 추론 가이드 참고.

출처: DeepSeek 공식 API 문서·changelog · 기술 보고서 · Artificial Analysis · 21세기경제보도 · 콴과학 · V2EX 커뮤니티. 프로덕션 결정 전 공식 요금·벤치마크·V4-Pro/Harness 출시 상태를 반드시 재확인하세요.

FAQ

자주 묻는 질문

예. V4-Pro와 V4-Flash 모두 7월 31일 공식 V4-Flash-0731 빌드를 포함해 Hugging Face에서 MIT 라이선스 오픈 웨이트로 제공되며, 상업적 사용·파인튜닝·재배포가 추가 허가 없이 가능합니다.

21세기경제보도 인용 공식 요금 기준, V4-Flash는 Claude Opus 4.8 대비 캐시 미스 입력 약 36배, 캐시 히트 입력 약 179배, 출력 약 89배 저렴합니다(백만 토큰당). 벤더 정가이며 독립 감사가 아닙니다.

확정된 날짜는 없습니다. Changelog에는 공식 V4-Pro 출시가 「가능한 한 빨리」 이어진다고만 명시되어 있습니다. 8월 10–20일 GA 창은 중국 매체 무기명 출처 보도이며 DeepSeek 미확인입니다. Agent 호스트 배포는 Mac Mini M4 임대 요금을 참고하세요.

부분적으로만 가능합니다. SWE-bench Verified처럼 널리 채택된 서드파티 벤치마크는 신뢰도가 높습니다. Terminal Bench 2.0, Toolathlon 등 Agent 점수는 DeepSeek 자체 미공개 Harness로 측정되었으며, 회사도 harness 선택에 매우 민감하다고 경고합니다. Claude Code, Cursor 등으로 독립 재현될 때까지 일반 역량 주장으로 보기는 이릅니다.

DeepSeek 최초 자체 Agent 실행 프레임워크로, 파일 편집·도구 호출·다단계 엔지니어링 작업을 처리하며 Claude Code 대안으로 포지셔닝됩니다. 2026년 7월 31일 changelog에서 처음 언급되었으며 아직 공개되지 않았습니다.

OpenAI·Anthropic 형식 API로 DeepSeek에 접속 중이라면 코드 변경은 필요 없습니다. deepseek-v4-flash가 새 공식 빌드를 가리킵니다. 폐기된 deepseek-chat / deepseek-reasoner 별칭을 쓰고 있다면 즉시 전환하세요. 배포 상세는 고객 센터를 참고하세요.