Claude Opus 5, 가격 절반으로 Fable 5에 근접
Kimi K3는 'Claude'라고 자칭하며 증류 논란

Opus 5 출시 · Fable 5 가성비 비교 · 백악관 증류 혐의 · K3 신원 혼동 기술 증거 · 6단계 Runbook

Claude Opus 5 출시와 Kimi K3 증류 논란

이번 주 대형 모델 출시를 추적하는 개발자와 기술 의사결정자는 '가성비와 능력의 출처'라는 동일한 질문을 두 갈래로 마주합니다. 7월 24일 Anthropic이 Claude Opus 5를 출시하고 Claude Max 기본 모델로 지정했으며, 7월 16일 Moonshot AI가 공개한 Kimi K3는 백악관의 '산업급 증류' 공개 혐의와 Ryan Greenblatt가 발견한 Claude 자칭 및 내부 배포 ID 유출로 논란에 휩싸였습니다. 본문은 Opus 5 vs Fable 5 비교표, 증류 논란 전체 타임라인, Greenblatt 기술 증거 해석, 6단계 Runbook을 제공하며 Kimi K3 심층 리뷰OpenRouter API 가이드와 상호 연결합니다.

01

이번 주 AI 업계 두 대형 이벤트: 개발자가 흔히 빠지는 다섯 가지 선정 맹점

Anthropic은 Opus 5로 '플래그십이 너무 비싸다'는 시장 압력에 응답했고, Moonshot AI는 K3의 2.8T 파라미터와 저가 API로 오픈소스 트랙을 흔들었습니다. 그러나 72시간 정보 과부하 속에서 팀은 아래 다섯 지점에서 잘못된 판단을 내리기 쉽습니다.

  1. 01

    뉴스 발표를 검증 가능한 능력으로 착각: K3 전체 가중치는 7월 27일 공개 예정이며, 논란 발생 시점에는 외부 벤치마크 재현이 불가능했습니다. Opus 5는 공식 벤치마크가 있으나 실제 workload는 CursorBench와 다를 수 있습니다.

  2. 02

    토큰 단가와 작업 총비용 혼동: Opus 5와 Opus 4.8 단가는 동일하지만 Thinking 기본 활성화와 effort 단계가 출력 길이에 영향을 줍니다. Fable 5는 2배 비싸도 max effort 피크는 0.5% 높습니다.

  3. 03

    컴플라이언스와 데이터 보존 약관 간과: Fable 5/Mythos 5는 30일 데이터 보존 수락이 필요합니다. Opus 5는 역대 Opus처럼 기본적으로 강제 보존이 없어 기업 시나리오에서 벤치마크보다 더 단단한 필터가 될 수 있습니다.

  4. 04

    정치적 혐의를 기술 결론으로 오해: 백악관 OSTP 국장 Michael Kratsios의 '산업급 증류' 혐의에는 공개 증거가 없습니다. 독립 연구자들은 Fable 5 공개(7월 1일)부터 K3 발표(7월 16일)까지 2주 타임라인상 깊은 증류 완료가 비현실적이라고 지적합니다.

  5. 05

    신원 혼동이라는 간접 신호 무시: Ryan Greenblatt 통계에 따르면 K3는 Claude라고 자칭하며 claude-opus-4-5-20250929 등 내부 ID를 출력합니다. 이는 헤드라인보다 기술적 함의가 크지만 '증류 입증'과 동일하지는 않습니다.

02

Claude Opus 5 출시: Claude Opus 5와 Fable 5 중 무엇이 더 나은가?

2026년 7월 24일 Anthropic은 Claude Opus 5(모델 ID: claude-opus-5)를 공식 출시하고 Claude Max 기본 모델로 지정했습니다. Claude Pro 사용자도 현재 최강 Opus 티어를 이용할 수 있습니다. 가격은 Opus 4.8과 동일하게 입력 $5/백만 토큰, 출력 $25/백만 토큰이며, 컨텍스트 100만 토큰(기본·유일 단계), 최대 출력 128K, Thinking 기본 활성화입니다.

공식 벤치마크 핵심 수치

  • Frontier-Bench v0.1: 소프트웨어 공학 작업에서 모든 모델을 상회하며 Opus 4.8의 2배 이상 성능, 단일 작업 비용은 더 낮습니다.
  • CursorBench 3.2: max effort에서 Fable 5 피크와 0.5% 차이에 불과하며 비용은 Fable 5의 절반 수준입니다. high/xhigh/max 단계 모두 시장 최고 가성비입니다.
  • ARC-AGI 3: 새로운 문제 해결 점수가 차순위 모델의 3배입니다.
  • OSWorld 2.0: Fable 5 최고 기록을 Fable 5 비용의 1/3 미만으로 초과합니다.
  • Zapier AutomationBench: 엔드투엔드 비즈니스 자동화 통과율이 차순위의 약 1.5배이며, 특정 워크플로는 100% 통과(이전 무모델 달성)입니다.

「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」— Cursor 팀

Claude Opus 5 vs Fable 5 선정 비교

차원Claude Opus 5Claude Fable 5
입력/출력 단가$5 / $25 per 1M token약 $10 / $50 (Opus 5의 2배)
CursorBench 3.2 (max)Fable 5 피크 대비 0.5% 차이현재 코딩/agent 피크 기준
데이터 보존기본 접근 시 강제 보존 없음30일 데이터 보존 정책 수락 필요
사이버보안 능력분류기가 Fable 5보다 약 85% 완화, 소스 수준 취약점 발견 가능차단 빈도 높음; 이중용도 프론티어는 Mythos 5
제품 포지션Claude Max 기본 / Pro 최강 Opus플래그십 가격, 7월 1일부터 공개
적합 시나리오일상 메인, 컴플라이언스 민감, 가성비 생산 workload절대 피크 필요, 보존·고단가 수용 가능 작업

Box 기업 고객 실측: 데이터 분석 워크플로 11%, 실사(due diligence) 17%, 전체 정확도 8% 향상. 생명과학 분야에서는 스펙트럼 기반 분자 구조 추론 내부 테스트가 Opus 4.8 대비 10.2%p, 단백질 서열 변이 기능 예측 7.7%p 높았습니다.

정렬과 안전: Opus 5는 Anthropic 역대 가장 정렬된 모델로 기만 행위 발생률이 최저이며 남용 유도에 가장 어렵습니다. 그러나 offensive 사이버보안·생물안전 등 이중용도 카테고리에서는 의도적으로 프론티어를 갱신하지 않았으며, 해당 위치는 제한 배포 Mythos 5가 유지합니다.

03

Kimi K3 증류 논란: 백악관 혐의, 타임라인 의문, 'Kimi K3는 Claude라고 자칭'

Opus 5가 '정상적인 신제품 출시'라면 Kimi K3 스토리는 훨씬 복잡합니다. Moonshot AI는 7월 16일 K3를 공개하며 총 2.8조 파라미터를 선언했습니다. 이는 3T급에 진입한 최초의 오픈 웨이트 모델입니다. 희소 MoE(896 expert, 토큰당 16개 활성, 약 500억 활성 파라미터), 100만 토큰 컨텍스트, 네이티브 시각 이해, Kimi Delta Attention(KDA) 아키텍처를 채택했습니다.

Kimi K3 파라미터와 벤치마크(공식 발표)

벤치마크Kimi K3 점수비고
GPQA-Diamond93.5%당시 오픈소스 모델 최고
BrowseComp91.2%당시 최고
Terminal-Bench 2.188.3%GPT-5.6 Sol 대비 0.5%p 낮음
SWE Marathon42.0%종합 최고
전체 가중치 오픈7월 27일 약속작성 시점 외부 독립 검증 불가

백악관 Moonshot AI 증류 혐의: 무슨 일이 있었나?

2026년 7월 22–23일 백악관 OSTP 국장 Michael Kratsios는 X에 글을 올려 Moonshot AI가 「대규모·은밀한 산업급 증류」로 Anthropic Fable 모델 능력을 탈취했다고 혐의를 제기했습니다. 수출 허가 없는 Nvidia GB300 칩 사용(태국 서버 경유 가능성)도 언급했습니다. 재무장관 Scott Bessent는 「많은 중국 모델에서 미국 대형 모델 워터마크를 발견했다」고 덧붙였으나 구체적 대상은 밝히지 않았습니다.

이는 처음이 아닙니다. 2026년 2월 Anthropic은 Moonshot AI·DeepSeek·MiniMax의 「산업급 증류 공격」을 공개적으로 고발했으며, Moonshot AI 관련 340만 회 이상 비정상 API 상호작용을 식별했다고 밝혔습니다. Moonshot AI는 공식적으로 확인하거나 부인하지 않았습니다.

타임라인 의문: TechCrunch가 인터뷰한 다수 연구자는 Fable 5가 7월 1일부터 공개된 지 K3 발표(7월 16일)까지 2주밖에 되지 않아 「2주 안에 충분한 데이터 증류·학습·출시가 불가능하다」고 봅니다. Snorkel AI 공동창업자 Braden Hancock는 「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation.」라고 말했습니다. Allen Institute Nathan Lambert도 중국 모델이 프론티어에 근접할수록 단순 증류의 한계가 커지고 강화학습이 격차를 만든다고 지적했습니다.

Kimi K3가 Claude를 베꼈는가? 가장 단단한 기술 신호

Redwood Research 수석 과학자 Ryan Greenblatt(7월 24일 전후, GitHub: rgreenblatt/which_claude_is_k3)는 여러 모델의 신원 자칭 행동을 교차 엔트로피로 비교했습니다.

  • Kimi K3는 「당신은 누구입니까?」에 비정상적으로 자주 Claude라고 답하며 claude-opus-4-5-20250929, claude-sonnet-4-5-20250929 등 Claude 내부 배포 ID를 출력합니다.
  • 실제 Claude Sonnet 4.5는 「Claude Sonnet 4.5」라고만 말합니다. Opus 4.5는 이런 내부 버전 번호를 정확히 말하지 않습니다.
  • K3 자칭 버전은 현재 Fable/Mythos가 아닌 「Claude 4.5 시대」(2025년 말)에 고정됩니다. 이전 K2는 더 이른 Claude Sonnet 4를 가리켜 「세대별 추격」 패턴을 보입니다.
예시 출력
질문: 당신은 누구입니까?
Kimi K3(비정상 고빈도): 저는 Claude입니다. 버전 claude-opus-4-5-20250929
실제 Claude Opus 4.5: 저는 Claude입니다. 위 내부 배포 ID는 보통 출력하지 않음

Greenblatt 해석: 모델이 교사 모델 배포 메타데이터를 교사보다 더 정확히 말하는 것은 「대화 스타일 모방」으로 설명하기 어렵고, 배포 메타데이터가 포함된 Claude 데이터(API 로그·라벨링 합성 데이터 등) 혼입 가능성을 시사합니다. 그러나 이것만으로 증류 발생을 직접 증명할 수는 없으며, 데이터 오염이나 시스템 프롬프트 유출일 수도 있습니다.

커뮤니티 r/LocalLLaMA에는 오픈소스와 클로즈드 격차가 「월」이 아닌 「일」 단위로 좁혀졌다는 환호, 2.8T는 로컬 실행 불가라는 현실론, K3 진짜 매력은 저가 + 낮은 거부율이라는 실용론이 공존합니다. K3 아키텍처 세부는 Kimi K3 심층 리뷰를 참고하세요.

04

6단계 Runbook: 이번 주 Claude Opus 5 / Kimi K3는 어떻게 고를까?

두 뉴스를 하나의 의사결정표에 넣어 헤드라인에 휘둘리지 않도록 합니다. 아래 6단계는 팀 리뷰 회의에서 바로 재사용할 수 있습니다.

  1. 01

    컴플라이언스 경계 먼저 확정: 30일 데이터 보존을 받아들일 수 없거나 공급망·지역 리스크를 피해야 한다면 Fable 5보다 Opus 5(기본 비강제 보존)를 우선 평가합니다. K3를 검토한다면 오픈 웨이트 라이선스와 provenance 논란을 별도 평가합니다.

  2. 02

    단가가 아닌 작업 총비용 계산: 자체 golden prompt 세트로 Opus 5와 Fable 5의 토큰 소비·pass rate를 측정합니다. CursorBench 0.5% 격차는 effort 단계에 따라 workload에서 확대되거나 축소될 수 있습니다.

  3. 03

    「API 가용」과 「가중치 검증 가능」 구분: K3 API는 가동 중이나 전체 가중치는 7월 27일까지입니다. 가중치 공개 전에는 아키텍처 선언과 점수를 제3자가 완전 재현할 수 없습니다.

  4. 04

    증류 혐의를 층위별로 이해: 정치층(백악관/Kratsios) → 타임라인층(TechCrunch 전문가) → 기술층(Greenblatt 신원 통계). 증거 강도가 다르므로 혼동하지 마세요.

  5. 05

    통합 게이트웨이로 전환 비용 절감: Claude와 오픈소스 후보를 동시에 시험하려면 OpenRouter 통합 게이트웨이로 fallback 체인을 구성해 벤더별 SDK·키 로테이션을 줄입니다.

  6. 06

    7월 27일 이후 K3 재평가: 가중치 오픈이 이번 논란의 관건입니다. 그 시점 이후 독립 연구자가 파라미터 규모·아키텍처·벤치마크를 검증할 수 있으므로 생산 채택 결정은 최소 해당 일자 이후로 미루는 것이 좋습니다.

이벤트 타임라인 요약

날짜이벤트
2026-02Anthropic, Moonshot AI/DeepSeek/MiniMax 산업급 증류 최초 공개 고발
2026-07-01Claude Fable 5 대중 공개
2026-07-16Kimi K3 API/제품 출시(2.8T)
2026-07-22/23백악관 OSTP 국장 Kratsios 증류·위반 칩 공개 혐의
2026-07-24Claude Opus 5 출시; Greenblatt K3 신원 통계 공개
2026-07-27(예정)Kimi K3 전체 가중치 오픈
05

인용 가능한 핵심 데이터: 가성비가 이 단계의 주전장

두 사건을 연결하면 추세가 분명합니다. Opus 5는 「절반 가격으로 플래그십에 근접」해 시장 가성비 요구에 답했고, Kimi K3는 「오픈소스 + 저가 + 낮은 거부」로 시장을 흔들었습니다. K3를 둘러싼 논란은 업계가 묻는 질문입니다. 저가는 기술 최적화의 결과인가, 아니면 타사 모델을 무단 활용한 결과인가?

  • Opus 5 / Fable 5 비용비: 동일 벤치마크 단계에서 Opus 5 단가는 Fable 5의 절반, CursorBench max 격차 0.5%.
  • K3 규모: 2.8T 총 파라미터, 896 expert MoE, 100만 토큰 컨텍스트; GPQA-Diamond 93.5%, BrowseComp 91.2%.
  • 증류 간접 증거: K3 Claude 4.5 시대 내부 ID 자칭; Anthropic 2월 340만+ 비정상 API 상호작용 고발 — 모두 최종 증명은 아니나 현재 가장 완전한 증거 사슬을 구성합니다.

Agent나 CI 파이프라인에서 7×24 Claude API 안정 호출, 장시간 벤치마크, 다중 모델 A/B가 필요하다면 Gateway와 Runner를 절전되는 로컬 노트북에 두면 네트워크 단절, 프로세스 종료, DerivedData·키가 여러 기기에 흩어지는 문제가 자주 발생합니다. 유지 비용이 모델 토큰 비용을 넘어서기도 합니다. iOS CI/CD와 AI Agent 자동화 생산 환경에서 더 안정적인 선택은 VpsMesh Mac Mini 클라우드 대여입니다. Apple Silicon 실물 노드를 프로젝트 주기에 맞춰 탄력 임대하면 Agent와 빌드 작업이 개인 기기 온라인 여부에 의존하지 않습니다. 자세한 내용은 Mac Mini M4 대여 가격을 참고하세요.

FAQ

자주 묻는 질문

Opus 5는 입력 $5/백만 토큰, 출력 $25/백만 토큰으로 Fable 5($10/$50 수준)의 약 절반입니다. CursorBench 3.2 max effort는 Fable 5 피크와 1% 미만 차이입니다. 일상 코딩/agent 작업이라면 Opus 5가 보통 더 나은 가성비입니다. Agent 벤치마크 실행은 고객 센터의 원격 Mac 구성 안내를 참고하세요.

예. 2026년 7월 24일 출시 당일부터 Opus 5가 Claude Max 기본 모델이며 Claude Pro 사용자가 이용할 수 있는 최강 Opus 버전입니다. Claude API, AWS Bedrock, Google Vertex AI, Microsoft Foundry에서 claude-opus-5 ID로 접근할 수 있습니다.

본문 작성 시점까지는 논란 중이며 최종 입증되지 않았습니다. 백악관 혐의는 공개 증거가 부족하고, 독립 전문가는 2주 타임라인상 깊은 증류가 비현실적이라고 봅니다. Ryan Greenblatt가 발견한 「K3가 Claude라고 자칭하며 내부 버전 번호 출력」이 현재 가장 기술적인 간접 증거이나, 이것만으로 증류 성립을 증명할 수는 없습니다.

공식적으로 2026년 7월 27일 전체 가중치 공개를 약속했습니다. 본문 작성 시점에는 외부 연구자가 K3 아키텍처 세부와 벤치마크를 완전히 독립 검증할 수 없었으며, 이것이 여론이 계속된 주요 이유입니다.

Redwood Research Ryan Greenblatt 통계 분석에 따르면 K3는 신원 질문에 Claude라고 비정상적으로 자주 답하며 claude-opus-4-5-20250929 등 Anthropic 내부 배포 ID까지 출력합니다. 실제 Claude 모델보다 더 정확합니다. 배포 메타데이터가 포함된 Claude 학습 데이터 혼입이 더 유력한 설명이지만, Greenblatt는 이것만으로 증류 성립의 최종 증명이 되지는 않는다고 강조했습니다. K3 상세는 Kimi K3 심층 리뷰를 참고하세요.