Claude Opus 5 halbiert den Preis
Kimi K3 behauptet, Claude zu sein

Opus-5-Release · Opus vs Fable 5 · Destillations-Streit · Greenblatt-Evidenz · DSGVO · 6-Schritte-Runbook

Claude Opus 5 Release und Kimi K3 Destillations-Streit

Entwickler und Tech-Leads, die die Modell-Releases dieser Woche verfolgen, sehen zwei Schlagzeilen mit demselben Kern: Frontier-Intelligenz zu erschwinglichen Preisen — und woher die Fähigkeit tatsächlich stammt. Am 24. Juli veröffentlichte Anthropic Claude Opus 5 als neues Claude-Max-Standardmodell. Am 16. Juli brachte Moonshot AI Kimi K3 heraus — und sah sich einer Weißhaus-Anklage wegen industrieller Destillation gegenüber, während der Forscher Ryan Greenblatt fand, dass K3 sich als Claude ausgibt und interne Deployment-IDs ausgibt. Dieser datengetriebene Leitfaden liefert eine Opus-5-vs-Fable-5-Vergleichstabelle, eine Destillations-Timeline, eine technische Einordnung der Greenblatt-Evidenz, ein Sechs-Schritte-Auswahl-Runbook sowie Verweise auf unseren Kimi-K3-Review und die OpenRouter-Anleitung.

01

Zwei Schlagzeilen, fünf typische Fehlentscheidungen in Teams

Anthropic reagierte auf Preisdruck, indem es die Lücke zwischen Flagship- und Alltagsmodell schloss. Moonshot antwortete mit einem 2,8T-Open-Weight-Launch zu einem Bruchteil der Frontier-API-Kosten. In einem 72-Stunden-Fenster lesen Teams die Signale oft in fünf vorhersehbaren Fallen falsch.

  1. 01

    Pressemitteilungen als verifizierte Leistung behandeln: K3-Vollgewichte sind erst für den 27.07. angekündigt; externe Forscher konnten Benchmarks während des Streits nicht reproduzieren. Opus 5 hat offizielle Zahlen, aber Ihre Workloads entsprechen möglicherweise nicht CursorBench.

  2. 02

    Token-Listenpreis mit Task-Kosten verwechseln: Opus 5 hält Opus-4.8-Preise (5/25 USD pro Million Token), Thinking ist standardmäßig aktiv; Effort-Stufen ändern die Output-Länge. Fable 5 kostet etwa das Doppelte, führt aber auf CursorBench 3.2 max effort mit 0,5 % Vorsprung.

  3. 03

    Datenaufbewahrung und DSGVO ignorieren: Fable 5 und Mythos 5 erfordern Opt-in für 30-Tage-Datenaufbewahrung. Opus 5 folgt der bisherigen Opus-Politik — keine erzwungene Aufbewahrung für allgemeinen Zugang. Für EU-Unternehmen kann das relevanter sein als Benchmark-Deltas (Art. 5 DSGVO: Datenminimierung; Art. 17: Löschrecht).

  4. 04

    Politische Anklagen mit Beweisen gleichsetzen: OSTP-Direktor Michael Kratsios warf Moonshot verdeckte industrielle Destillation vor — ohne öffentliche Belege. Unabhängige Forscher bezweifeln, dass tiefe Destillation von Fable 5 (öffentlich seit 1. Juli) in zwei Wochen abgeschlossen sein kann.

  5. 05

    Das Identitäts-Signal übersehen: Greenblatts Analyse zeigt, dass K3 überproportional Claude angibt und Strings wie claude-opus-4-5-20250929 ausgibt. Technisch interessanter als die Schlagzeile — aber kein schlüssiger Destillationsbeweis.

02

Claude Opus 5 Release: lohnt sich der Wechsel von Fable 5?

Anthropic veröffentlichte Claude Opus 5 am 24.07.2026 (Modell-ID: claude-opus-5) und machte es sofort zum Claude-Max-Standard — dem stärksten Modell für Claude-Pro-Abonnenten. Preise unverändert gegenüber Opus 4.8: 5 USD Input / 25 USD Output pro Million Token. Kontextfenster 1M Token (eine Stufe), max. Output 128K, Thinking standardmäßig aktiv.

Veröffentlichte Benchmarks

  • Frontier-Bench v0.1: schlägt alle anderen Modelle bei Software-Engineering-Tasks mit mehr als 2× Opus 4.8 bei niedrigeren Kosten pro Task.
  • CursorBench 3.2: innerhalb von 0,5 % des Fable-5-Peaks bei max effort, etwa halbe Task-Kosten; bestes Preis-Leistungs-Verhältnis bei high, xhigh und max.
  • ARC-AGI 3: das nächstbeste Modell bei neuartigen Problemen.
  • OSWorld 2.0: schlägt Fable-5-Bestwert mit weniger als einem Drittel der Kosten.
  • Zapier AutomationBench: Spitzenplatz; 100 % Pass-Rate bei einem End-to-End-Workflow, den kein früheres Modell abschloss.

Claude Opus 5 liefert nahezu Fable-5-Intelligenz zu Opus-Geschwindigkeit und -Kosten. Auf CursorBench liegt es knapp unter Fable 5 und zeigt viele gleiche Verhaltensmuster. — Cursor-Team

Claude Opus 5 vs Fable 5: Vergleichstabelle

DimensionClaude Opus 5Claude Fable 5
Input/Output-Preis5 / 25 USD pro Million Tokenca. 10 / 50 USD pro Million Token (~2× Opus 5)
CursorBench 3.2 (max)Innerhalb 0,5 % des Fable-5-PeaksAktuelle Coding/Agent-Referenz
DatenaufbewahrungKeine erzwungene Aufbewahrung für allgemeinen Zugang30-Tage-Retention-Opt-in erforderlich
DSGVO-RelevanzGeringere Aufbewahrungspflicht; einfachere LöschkonzepteOpt-in-Retention erfordert AVV-Prüfung und Löschprozesse
Cybersecurity-Klassifikatorenca. 85 % weniger Eingriffe als Fable 5; nutzbar für Source-Level-Vuln-DiscoveryHäufigere Blocks; Dual-Use-Frontier bei Mythos 5
PositionierungClaude-Max-Standard / stärkstes Opus für ProFlagship-Preis; öffentlich seit 1. Juli
Ideal fürTagesproduktion, compliance-sensible, kostenbewusste Agent-WorkloadsAbsolute Peak-Tasks, wenn 2× Kosten und Retention akzeptabel

Enterprise-Kunde Box meldete 8 % Gesamtgenauigkeitsgewinn — 11 % bei Datenanalyse-Workflows, 17 % bei Due-Diligence. Life-Sciences-Interntests: +10,2 Punkte bei Molekülstruktur-Inferenz aus Spektroskopie, +7,7 Punkte bei Proteinvarianten-Funktionsvorhersage vs. Opus 4.8.

i

Alignment: Opus 5 ist Anthropics bisher am besten alignedes Modell — niedrigste Täuschungsrate, schwerer in Missbrauch zu verleiten. Anthropic pushte Opus 5 bewusst nicht an der Frontier bei Offensive-Cyber oder Biologie; dieser Slot bleibt Mythos 5.

03

Kimi K3 Destillations-Streit: Hat Moonshot Claude kopiert?

Moonshot AI veröffentlichte Kimi K3 am 16.07.2026 mit 2,8 Billionen Gesamtparametern — dem ersten Open-Weight-Modell über der 3T-Marke. Sparse MoE (896 Experten, 16 aktiv pro Token, ca. 50B aktive Parameter), 1M-Token-Kontext, native Vision, Kimi Delta Attention (KDA).

Offizielle Benchmark-Snapshot

BenchmarkKimi K3 ScoreAnmerkung
GPQA-Diamond93,5 %Bester Open-Weight-Score zum Launch
BrowseComp91,2 %Kategoriebestwert zum Launch
Terminal-Bench 2.188,3 %0,5 Punkte hinter GPT-5.6 Sol
SWE Marathon42,0 %Kategoriebestwert gesamt
VollgewichteZugesagt 27.07.Zum Streit-Höhepunkt nicht unabhängig verifizierbar

Weißhaus-Anklage

Am 22./23. Juli postete OSTP-Direktor Michael Kratsios auf X, Moonshot habe «großangelegte, verdeckte industrielle Destillation» betrieben, um proprietäre US-Technologie aus Anthropics Fable-Modell zu stehlen — und separat export-restricted Nvidia GB300-Chips über Server in Thailand bezogen. Finanzminister Scott Bessent sagte, man finde «Wasserzeichen unserer US-LLMs auf vielen chinesischen Modellen» — ohne zu definieren, was das bedeutet.

Nicht die erste Runde: Im Februar 2026 nannte Anthropic öffentlich Moonshot, DeepSeek und MiniMax und behauptete über 3,4 Millionen anomale API-Interaktionen als «gezielte Capability-Extraktion», teils bis zu Senior-Moonshot-Mitarbeitern über Request-Metadaten zurückverfolgbar. Moonshot hat nie öffentlich bestätigt oder dementiert.

!

Timeline-Einwand: TechCrunch interviewte Forscher, die Destillation als Erklärung für K3 bezweifeln — Fable 5 ist erst seit dem 1. Juli öffentlich, zwei Wochen für Destillation, Training und Release. Braden Hancock (Snorkel-AI-Mitgründer): «Man kann nicht so viele Daten destillieren, ein Modell trainieren und in zwei Wochen releasen.» Nathan Lambert (Allen Institute for AI): Destillations-Margeneffekt schrumpft, chinesische Labs setzen stärker auf Reinforcement Learning.

Warum behauptet Kimi K3, Claude zu sein? Greenblatt-Evidenz

Um den 24. Juli veröffentlichte Redwood-Research-Chefwissenschaftler Ryan Greenblatt (GitHub: rgreenblatt/which_claude_is_k3) eine statistische Vergleichsanalyse der Modell-Selbstidentifikation. Befund:

  • Kimi K3 gibt überproportional Claude-Identität an und emittiert manchmal exakte Anthropic-Deployment-IDs wie claude-opus-4-5-20250929 und claude-sonnet-4-5-20250929.
  • Echtes Claude Sonnet 4.5 sagt nur «Ich bin Claude Sonnet 4.5.» Echtes Opus 4.5 nennt diese internen Strings nicht präzise.
  • K3s geleakte Identität zeigt auf die Claude-4.5-Ära (Ende 2025), nicht aktuelles Fable/Mythos; früheres Kimi-K2-Signal wies auf früheres Claude Sonnet 4 — ein Generation-für-Generation-Muster.
beispiel
F: Wer bist du?
Kimi K3 (anomal oft): Ich bin Claude, Version claude-opus-4-5-20250929
Echtes Claude Opus 4.5: Nennt diese interne Deployment-ID typischerweise nicht

Greenblatts Einordnung: Deployment-Metadaten eines Lehrermodells präziser zu reproduzieren als das Lehrermodell über sich selbst lässt sich schwer als Gesprächsmimikry erklären. Es deutet auf Training mit Claude-Daten mit Deployment-Metadaten-Labels hin — API-Logs oder getaggte Synthese-Daten. Er betont: Das beweist keine Destillation; Kontamination oder geleakte Prompts bleiben Alternativen.

r/LocalLLaMA reagiert dreifach: Begeisterung, dass Open-Closed-Gaps in Tagen gemessen werden; Skepsis, dass fast niemand 2.8T lokal betreiben kann; und die nüchterne Sicht, dass K3s echter Verkaufspunkt Preis plus weniger Refusals ist, nicht Fable-5-Sieg. Specs im Kimi-K3-Architektur-Review.

04

Sechs-Schritte-Runbook: Opus 5 vs Kimi K3 diese Woche

Nutzen Sie diese Checkliste im Team-Review statt allein auf Schlagzeilen zu reagieren.

  1. 01

    Compliance-Grenzen zuerst setzen: Bei 30-Tage-Retention, DSGVO-Löschpflichten oder Geo-/Supply-Chain-Risiko Opus 5 (keine erzwungene Retention) vor Fable 5; bei K3 Open-Weight-Lizenz und Herkunfts-Streit separat bewerten.

  2. 02

    Gesamte Task-Kosten messen, nicht Listenpreis: Golden-Prompt-Set auf Opus 5 vs Fable 5 laufen lassen; Token-Burn plus Pass-Rate vergleichen — die 0,5%-CursorBench-Lücke kann sich mit Effort-Stufen ändern.

  3. 03

    API-Verfügbarkeit von Gewicht-Verifizierbarkeit trennen: K3-API ist live, Vollgewichte kommen 27.07.; Architektur-Claims und Scores bis dahin nicht voll reproduzierbar.

  4. 04

    Destillations-Evidenz schichten: politisch (Weißhaus/Kratsios) → Timeline (TechCrunch-Experten) → technisch (Greenblatt-Identitätsstatistik). Nicht zu einem Urteil kollabieren.

  5. 05

    Switching-Kosten mit Gateway senken: Claude neben Open-Alternativen testen via OpenRouter-Leitfaden statt separate SDK-Stacks pro Anbieter.

  6. 06

    K3 nach 27.07. neu bewerten: Open Weights sind der Schlüsselknoten — Produktions-Adoption bis unabhängige Verifikation von Parametern, Architektur und Benchmark-Reproduktion zurückstellen.

Ereignis-Timeline

DatumEreignis
2026-02Anthropics erste öffentliche Destillations-Anklage vs Moonshot/DeepSeek/MiniMax
2026-07-01Claude Fable 5 öffentlich verfügbar
2026-07-16Kimi K3 API/Produkt-Launch (2,8T Parameter)
2026-07-22/23Weißhaus OSTP Destillations- + Chip-Anklage
2026-07-24Claude Opus 5 Release; Greenblatt Identitätsanalyse
2026-07-27 (geplant)Kimi K3 vollständige Open Weights
05

Harte Zahlen: Preis-Leistung ist das eigentliche Schlachtfeld

Nebeneinander ist das Muster klar. Anthropic schließt mit Opus 5 die Flagship-vs-Alltag-Preislücke. Moonshot drückt Open Weight, ultra-günstig, weitgehend unbeschränkt mit K3. Der Streit fragt im Kern: Wenn ein Lab Frontier-Leistung zum Bruchteil der Kosten behauptet — wie unterscheidet man bessere Technik von stiller Mitfahrt auf fremdem Modell?

  • Opus 5 / Fable 5 Kostenverhältnis: ca. halber Token-Preis bei vergleichbaren Stufen; 0,5 % CursorBench-max-Gap.
  • K3-Skalierung: 2,8T Gesamtparameter, 896-Expert-MoE, 1M Kontext; GPQA-Diamond 93,5 %, BrowseComp 91,2 %.
  • Destillations-Indirektsignale: K3-Selbst-ID als Claude-4.5-Ära-Internstrings; Anthropics Feb-Claim von 3,4M+ anomalen API-Calls — informativ, nicht schlüssig.

Laptop-Gateways für Agent-Pipelines erzeugen Netzwerkabbrüche, gekillte Prozesse und verstreute Secrets — oft teurer als Token. Linux-VPS fehlt Metal und Keychain; geteilte Hosts erzeugen API-Key-Konflikte. Für stabile iOS-CI/CD und AI-Agent-Automatisierung in Produktion ist VpsMesh Mac Mini Cloud-Miete in der Regel die bessere Lösung: dedizierte Apple-Silicon-Knoten, projektzyklisch mietbar, damit Agenten und Builds laufen, ohne dass Ihr Rechner online bleiben muss. Preise: Mac Mini M4 Mietpreise. Setup: Hilfezentrum.

FAQ

Häufige Fragen

Opus 5 bleibt bei 5/25 USD pro Million Input/Output-Token — etwa die Hälfte von Fable 5 (ca. 10/50 USD). Auf CursorBench 3.2 max effort liegt es innerhalb von 0,5 % des Fable-5-Peaks. Für tägliches Coding und Agent-Tasks ist Opus 5 meist das bessere Preis-Leistungs-Verhältnis. Remote-Mac-Setup für Agent-Benchmarks: Hilfezentrum.

Ja. Seit dem 24.07.2026 ist Opus 5 Claude-Max-Standard und das stärkste Opus für Claude Pro. Zugang über Claude API, AWS Bedrock, Google Vertex AI und Microsoft Foundry unter Modell-ID claude-opus-5.

Unbestätigt und umstritten. Die Weißhaus-Anklage lieferte keine öffentlichen Belege. Forscher halten das Zwei-Wochen-Fenster zwischen Fable-5-Release und K3-Launch für zu kurz für tiefe Destillation. Ryan Greenblatts Befund, dass K3 sich als Claude mit exakten Deployment-IDs ausgibt, ist das stärkste technische, aber nicht schlüssige Signal bisher.

Moonshot hat den 27.07.2026 zugesagt. Zum Veröffentlichungszeitpunkt waren die Gewichte noch nicht verfügbar — Architektur- und Benchmark-Claims konnten nicht unabhängig verifiziert werden, ein Hauptgrund, warum der Streit offen bleibt.

Greenblatts statistische Analyse zeigt, dass K3 überproportional Claude angibt und manchmal Anthropic-interne Deployment-IDs wie claude-opus-4-5-20250929 ausgibt — präziser als echte Claude-Modelle über sich selbst. Wahrscheinlichste Erklärung: Training auf Claude-Daten mit Deployment-Metadaten; Greenblatt betont, dass dies allein keine Destillation beweist. Mietpreise für Benchmark-Infrastruktur: Mac Mini M4 Mietpreise.