1,5T Parameter · SFT/RL-Upgrade · Grok-4.7-Roadmap · Kimi-K3-Druck · Musk-Time-Puffer
Am 28.07.2026 antwortete Elon Musk auf X dem Vercel-CEO Guillermo Rauch: xAI plant Grok 4.6 für ca. 7. August — 1,5 Billionen Parameter, deutlich verbessertes SFT und RL — gefolgt von Grok 4.7 mit 2,1 Billionen Parametern wenige Wochen später. Das sind drei Frontier-Modelle in rund zwei Monaten nach Grok 4.5, ohne Benchmarks, Preise oder Model Card. Wer Agent-Stacks evaluiert oder auf API-Preise wartet, erhält hier Timeline, Grok-Datentabellen, Wettbewerbsvergleich, SFT/RL-Kontext, markierte Kontroversen und ein Sechs-Schritte-Runbook — jede Angabe mit Quellenstufe. Datenstand: 30.07.2026.
Auf dem Papier existiert nur ein X-Post. Alles Weitere — 1,5 Billionen Parameter, deutlich verbessertes SFT & RL, Grok 4.7 mit 2,1 Billionen — stammt aus dieser einen Quelle, ohne Model Card, Benchmark-Suite oder Preisseite wie bei Grok 4.5. Für Build-Entscheidungen ist diese Unterscheidung entscheidend.
Chronologie in harten Datenpunkten:
| Datum | Ereignis |
|---|---|
| 08.07.2026 | xAI veröffentlicht Grok 4.5 für Coding und Agenten, Co-Training mit Cursor auf echten Entwicklersessions. 500K Token Kontext, Preis 2 USD/6 USD pro Mio. Input/Output, Model Card mit 15 Benchmarks. |
| 16.–26.07.2026 | Moonshot AI Kimi K3 von Hosted Preview zu Open-Weight-Release (2,8T Parameter, 1M Token). Hugging-Face-Trend #1; Musk lobt in Kommentaren. |
| 28.07.2026 | Musk postet Grok-4.6/4.7-Roadmap als Antwort an Rauch. Am selben Tag veröffentlichen über 1.200 Mitarbeiter von OpenAI, Anthropic, Google DeepMind und Meta den Brief „Pacing the Frontier". |
| ~07.08.2026 (Ziel) | Grok 4.6, 1,5T Parameter, SFT/RL-Upgrade statt reiner Skalierung. |
| Ende Aug.–Anfang Sep. 2026 (Schätzung) | Grok 4.7, 2,1T Parameter — laut Musk „in jeder Hinsicht besser als 4.6, außer etwas langsamer, dafür effizienter". |
Fünf häufige Blindspots vor dem Build-Go:
Einzige Quelle ist ein Tweet: Kein xAI-Blog, keine Model Card, kein Produktseiten-Update — nur eine öffentliche Aussage ohne Verbindlichkeit.
„Musk time" einplanen: xAI-, Tesla- und SpaceX-Termine verschieben sich historisch um Tage bis Wochen; „ca. 7. August" ist Ziel, kein SLA.
Parameter ≠ Capability: Musk betont SFT & RL, nicht reine Skalierung; 4.7 wird größer, aber „etwas langsamer".
Kimi K3 nicht ignorieren: Grok-4.6-Ziel liegt ~10 Tage nach K3-Open-Weight — plausibelster Grund für xAIs Release-Kompression.
Branchen-Spaltung beim Tempo: Am selben Tag wie die Grok-Ankündigung erscheint „Pacing the Frontier" — xAI fehlt auf der Unterzeichnerliste.
| Modell | Datum | Parameter | Fokus | Status |
|---|---|---|---|---|
| Grok 4.3 Beta | 17.04.2026 | Nicht veröffentlicht | Baseline | Veröffentlicht |
| Grok 4.5 | 08.07.2026 | Nicht veröffentlicht (Single SKU) | Coding/Agenten, Cursor-Co-Training | Veröffentlicht, benchmarked |
| Grok 4.6 | ~07.08.2026 | 1,5T | SFT/RL-Upgrade | Tweet-Ankündigung |
| Grok 4.7 | ~Ende Aug.–Anfang Sep. | 2,1T | Upgrade vs. 4.6, Token-Effizienz | Tweet-Ankündigung |
Alle Grok-4.6/4.7-Werte sind unverifizierte Herstellerangaben aus einem Social-Media-Post — als Richtwert, nicht als Spec.
| Modell | Anbieter | Parameter | Kontext | Preis (Input/Output/Mio.) | Quelle |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | Nicht veröffentlicht | 500K | 2 USD / 6 USD | xAI offiziell |
| Grok 4.6 (Ankündigung) | xAI | 1,5T | Nicht veröffentlicht | Nicht veröffentlicht | Musk X-Post (unverifiziert) |
| Kimi K3 | Moonshot AI | 2,8T MoE (~16/896 aktiv) | 1M | 0,30 USD / 3 USD Input, 15 USD Output | Moonshot + Hugging Face |
| Claude Fable 5.1 (Gerücht) | Anthropic | Nicht veröffentlicht | Nicht veröffentlicht | Gerücht: Fable-5-Niveau (10/50 USD) | 36kr, WinCentral — unbestätigt |
| GPT-5.6 Sol | OpenAI | Nicht veröffentlicht | Nicht veröffentlicht | Nicht veröffentlicht | OpenAI offiziell |
Grok 4.6 und Fable 5.1 sind Pre-Release-Angaben — für Timing, nicht für Head-to-Head. Siehe Grok-4.5-Review und Kimi-K3-Erklärung.
Musk betont „significantly improved SFT & RL" — derselbe Post-Training-Ansatz wie bei Grok 4.5: ~15.954 Output-Token pro SWE-Bench-Pro-Task vs. 67.020 bei Opus 4.8 (Faktor 4,2), laut Cursor-Session-Daten statt reiner Modellgröße.
Datenbasiertes Vorgehen für Entwickler, Entscheider und Agent-Ingenieure:
Quellenstufe prüfen: X-Post vs. xAI-Blog/Model Card trennen — 4.6 hat nur Ersteres; alles als „Ankündigung/unverifiziert" labeln.
Musk-Time-Puffer: „Ca. 7. August" als Fenster, nicht Deadline; 1–2 Wochen Slack in Budget und Vendor-Auswahl.
Grok 4.5 als Anker: 15 Benchmarks, 2/6 USD — Baseline für Wechselentscheidung, nicht Parameter allein.
Kimi K3 und Fable 5.1 querlesen: K3: Frontend Code Arena 1.679 Punkte, Artificial Analysis #3; Fable-5.1-Gerüchte: August — drei Positionierungen, kein Head-to-Head.
SFT/RL operationalisieren: SFT formt Verhalten, RL optimiert Agent-Ketten. Metrik: bleibt 4.6 bei 15.954 vs. 67.020 Output-Token?
Hybrid-Routing planen: Grok Build, xAI-API, Cursor zuerst — Routine auf bewährten Modellen, Architektur auf verifizierten Frontier-Optionen bis Preise/Benchmarks da sind.
Supervised Fine-Tuning (SFT) trainiert auf kuratierten Beispielen; Reinforcement Learning (RL) nutzt Reward-Signale für mehrstufige Agentenaufgaben. Grok 4.5 erreichte Terminal-Bench 2.1 83,3 % und SWE-Bench Pro 64,7 % bei deutlich weniger Output-Token als Opus 4.8 — Post-Training auf Cursor-Sessions, nicht allein Skalierung.
4.6 springt auf 1,5T; 4.7 auf 2,1T, aber „etwas langsamer" — xAI segmentiert wie Anthropic (Sonnet/Opus) oder OpenAI (mini/full) nach Latenz vs. Qualität.
Grok 4.6 ~10 Tage nach K3-Open-Weight: Frontend Code Arena 1.679 Punkte, erstes Open-Weight-Modell vor allen Closed Models dort, Artificial Analysis global #3. Chinesische Medien (Futu News, 21st Century Business Herald) schätzen Marktreaktionen — Analystenschätzungen, keine bestätigten Unternehmenszahlen.
Kontroverse 1: Nur ein Tweet. Kein xAI-Blog, keine Model Card — eine Executive-Aussage ohne Verbindlichkeit.
Kontroverse 2: Benchmarks und Preise leer. Im Gegensatz zu Grok 4.5 keine unabhängige Evaluation — „1,5T" und „SFT/RL" sind Herstellerclaims.
Hintergrund: xAI-Sicherheitsstreit. Juli 2026 verklagte xAI einen Nutzer wegen CSAM-Generierung über Grok — erste Klage dieser Art. Common Sense Media stufte Grok im Januar 2026 als eines der schlechtesten Produkte für Minderjährigen-Schutz ein. Relevant für Vendor-Risk, nicht für reine Tech-Bewertung.
Hintergrund: Tempo-Spaltung. Am Grok-Ankündigungstag erscheint „Pacing the Frontier" mit über 1.200 Unterzeichnern — xAI fehlt; strategische Divergenz zwischen Verlangsamung und Beschleunigung.
August 2026 wird wahrscheinlich zum dichtesten Release-Monat — Token-Effizienz und Task-Kosten schlagen reine Leaderboard-Ränge als Entscheidungsbasis.
Multi-Model-Routing, Agent-Pipelines oder Grok/Cursor-Workflows auf dem Laptop scheitern oft an Instabilität und fehlendem 7×24-Betrieb; VPS ohne Apple Silicon fehlt Metal/Xcode. Für produktives iOS-CI/CD und KI-Agent-Automation mit DSGVO-relevanter Datenverarbeitung — dokumentierte Isolation, klare Verarbeitungsgrenzen — ist VpsMesh Mac Mini M4 Cloud-Miete meist die bessere Wahl: Unified Memory für große Kontexte, Remote-Knoten 24/7 für Routing-Tests ohne lokale Belastung. Preise: Mac Mini M4 Mietpreise, Setup: Hilfezentrum.
Musk nannte „ca. 7. August 2026" — kein offizielles xAI-Datum. Als Ziel mit Verschiebungsmöglichkeit behandeln. xAI auf X und x.ai folgen.
Grok 4.6: 1,5T, SFT/RL-Fokus. Grok 4.7: 2,1T, einige Wochen später, laut Musk überlegen außer etwas langsamerer Inferenz, dafür bessere Token-Effizienz — zwei SKUs für „schneller" vs. „stärker".
Zu früh. Keine Grok-4.6-Benchmarks; Kimi K3 hat verifizierte Scores; Fable 5.1 unbestätigt. Siehe Kimi-K3-Erklärung.
Unbekannt. Grok 4.5: 2 USD/Mio. Input, 6 USD/Mio. Output — Orientierung, keine Garantie. Agent-Testumgebungen: Hilfezentrum.
Nach Grok-4.5-Muster wahrscheinlich Grok Build, xAI-API, Konsole, dann Drittplattformen wie Cursor — für 4.6 unbestätigt.