1.5T 參數 · SFT/RL 後訓練升級 · Grok 4.7 路線圖 · Kimi K3 競爭壓力 · Musk time 彈性
馬斯克 7 月 28 日在 X 上回覆 Vercel CEO Guillermo Rauch 時透露,xAI 將於 8 月 7 日前後發布參數規模達 1.5 萬億的 Grok 4.6,隨後幾週內還會推出 2.1 萬億參數的 Grok 4.7——距離 Grok 4.5 發布僅一個月,意味著 xAI 今年夏天要連續推出三款前沿模型。若你正評估 Agent 程式設計棧或等待下一代 API 定價,本文將交付完整時間線、Grok 系列核心數據表、競品橫向對比、SFT/RL 升級解讀、爭議點辨析與六步發布前研判 Runbook。目前官方尚未公布基準分數和定價,以下資訊均標註來源層級。數據截止:2026-07-30
Grok 4.6 的預告並非孤立事件,而是嵌在 2026 年 7 月密集的大模型發布潮中。以下時間線是理解馬斯克路線圖的關鍵上下文:
| 日期 | 事件 |
|---|---|
| 2026 年 7 月 8 日 | xAI 正式發布 Grok 4.5,定位為「專為程式設計與智能體任務打造」的旗艦模型,與 Cursor 合作、使用真實開發者會話數據訓練,支援 50 萬 token 上下文,定價為每百萬 token 輸入 $2 / 輸出 $6 |
| 2026 年 7 月 16 日 | 競品 Moonshot AI(月之暗面)的 Kimi K3 以託管服務形式上線 |
| 2026 年 7 月 26 日 | Kimi K3 提前一天放出完整開源權重,2.8 萬億參數、100 萬 token 上下文,把開源模型的規模和能力都推上新高度 |
| 2026 年 7 月 28 日 | 馬斯克在回覆 Rauch 的貼文中首次公開 Grok 4.6 和 4.7 的路線圖與大致時間表——本文資訊的主要來源 |
| 約 2026 年 8 月 7 日(目標) | Grok 4.6 計劃發布,1.5 萬億參數,重點在 SFT 與 RL 層面的升級,而非單純堆參數 |
| 約 2026 年 8 月末至 9 月初(預估) | Grok 4.7 計劃跟進,2.1 萬億參數,馬斯克稱其「除了推理速度稍慢外,其他方面全面優於 4.6,且 token 效率更高」 |
需要提醒的是,馬斯克給出的時間表歷來存在彈性——業內常稱之為「Musk time」,實際發布日期比預告晚幾天到兩週並不罕見,發布前建議以 xAI 官方帳號或官網公告為準。
圍繞 Grok 4.6 預告,常見的五大認知盲區如下:
把 X 貼文等同於官方發布:目前唯一資訊源是馬斯克在 X 上的一條回覆貼,xAI 官方部落格和產品頁尚未同步公告,規格與日期均存在變動可能。
忽視「Musk time」彈性:xAI、Tesla、SpaceX 的歷史時間表常有數天到數週的延後,「大約 8 月 7 日」應視為目標而非承諾。
把參數規模直接等同於能力躍升:馬斯克特意強調 4.6 的升級重點在 SFT 與 RL 後訓練,而非單純堆參數;4.7 雖更大卻「推理稍慢」。
忽略 Kimi K3 帶來的競爭背景:Grok 4.6 目標日期卡在 K3 全面開源後約 10 天,xAI 壓縮發布節奏與業界競爭烈度上升直接相關。
混淆業界「減速」呼籲與 xAI 加速迭代:7 月 28 日同日,OpenAI、Anthropic 等 1200 餘名員工聯署「Pacing the Frontier」公開信,xAI 並未出現在簽署名單中。
| 模型 | 發布/目標時間 | 參數規模 | 定位重點 | 狀態 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026 年 4 月 17 日 | 未公開 | 上一代基線 | 已發布 |
| Grok 4.5 | 2026 年 7 月 8 日 | 未公開(非 MoE 單一 SKU) | 程式設計與智能體任務,與 Cursor 聯合訓練 | 已發布 |
| Grok 4.6 | 約 2026 年 8 月 7 日 | 1.5 萬億 | SFT/RL 大幅升級 | 官方預告,未發布 |
| Grok 4.7 | 約 2026 年 8 月末–9 月初 | 2.1 萬億 | 全面優於 4.6,token 效率更高 | 官方預告,未發布 |
註:參數規模、定價、基準分數均為廠商/馬斯克自述,Grok 4.6 與 4.7 目前均未有第三方獨立評測數據,表中「官方預告」資訊務必以正式發布為準。
| 模型 | 廠商 | 參數規模 | 上下文窗口 | 定價(輸入/輸出,每百萬 token) | 關鍵數據來源 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 未公開 | 50 萬 token | $2 / $6 | xAI 官方公告 |
| Grok 4.6(預告) | xAI | 1.5 萬億 | 未公開 | 未公開 | 馬斯克 X 貼文(未經第三方驗證) |
| Kimi K3 | 月之暗面 | 2.8 萬億(MoE,激活約 16/896 專家) | 100 萬 token | $0.30(快取命中)/$3(快取未命中)輸入,$15 輸出 | Moonshot 官方 + Hugging Face |
| Claude Fable 5.1(傳聞) | Anthropic | 未公開 | 未公開 | 傳聞維持 Fable 5 定價($10 輸入/$50 輸出) | 36kr、WinCentral 爆料,Anthropic 未確認 |
| GPT-5.6 Sol | OpenAI | 未公開 | 未公開 | 未公開 | OpenAI 官方公告 |
表格中 Grok 4.6、Claude Fable 5.1 相關數據均為預告或傳聞,不構成正式基準對比,僅供參考發布節奏和大致定位。詳見本站 Grok 4.5 深度評測與 Kimi K3 全面開源解析。
馬斯克強調 Grok 4.6 的升級重點在「SFT & RL」而非參數規模本身——這與 Grok 4.5 憑藉與 Cursor 合作獲取真實開發者會話數據、在保持較小輸出 token 消耗下拿到 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 成績的打法一脈相承。
無論你是 AI 開發者、技術決策者還是 Agent 工程師,在 Grok 4.6 正式落地前可按以下六步建立獨立判斷框架,避免被標題黨帶偏:
核對資訊源層級:區分「馬斯克 X 貼文」與「xAI 官方部落格/模型卡」——目前 4.6 僅有前者,無後者;在官方公告出來前,所有規格均應標註為「預告/未驗證」。
預留 Musk time 彈性窗口:將「約 8 月 7 日」視為目標區間而非硬 deadline,在選型與預算規劃中為 1–2 週延後留出緩衝。
以 Grok 4.5 為能力參照錨點:4.5 已有完整模型卡與 15 項基準分數(Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%、定價 $2/$6),用它衡量 4.6 是否值得切換,而非僅憑參數數字。
橫向對比 Kimi K3 與 Fable 5.1 傳聞:K3 已在 Frontend Code Arena 以 1679 分登頂、Artificial Analysis 智能指數全球第三;Fable 5.1 傳聞指向 8 月發布——三者定位不同,暫無法 head-to-head 對比。
理解 SFT/RL 升級的實際含義:監督微調用高品質樣本糾正輸出習慣,強化學習用獎勵信號教模型在多步驟 Agent 任務中「怎麼做才對」——關注發布後是否延續 4.5 的 token 效率優勢(4.5 在 SWE-Bench Pro 上輸出約 1.9 萬 token,Opus 4.8 約 6.7 萬)。
制定發布窗口內的混合路由策略:按 Grok 4.5 分發路徑推測,4.6 大概率先上 Grok Build、xAI API 與 Cursor;在正式定價公布前,保持「常規子任務走 Grok、高精度架構決策留給 Claude」的混合策略,避免過早 All-in 未驗證模型。
監督微調(SFT)是用人工標註或精選的高品質樣本去糾正模型的輸出習慣;強化學習(RL)則是用獎勵信號讓模型在真實任務鏈路中學會「怎麼做才對」,尤其是多步驟的智能體任務。馬斯克特意強調 Grok 4.6 的升級重點在「SFT & RL」而非參數規模本身,這與 Grok 4.5 的打法是延續的——Grok 4.5 當時憑藉與 Cursor 合作獲取的真實開發者會話數據,在保持較小輸出 token 消耗的情況下拿到了 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成績,處理同類任務所用的輸出 token 數量遠低於 Claude Opus 4.8(約 1.9 萬 token 對 6.7 萬 token)。
Grok 4.6 的 1.5 萬億參數相比 Grok 4.5 是明顯的規模躍升,但馬斯克沒有迴避「參數不是唯一變數」這一點——他隨後補充說 Grok 4.7 會更大(2.1 萬億)卻「推理稍慢」,暗示 xAI 內部很清楚參數規模和推理速度之間存在權衡,未來會用兩款不同定位的模型分別滿足「更強」和「更快」的需求,而不是用一個模型通吃所有場景。
Grok 4.6 的發布時間表恰好卡在 Kimi K3 全面開源引發業界震動之後的第 10 天左右。Kimi K3 在 Frontend Code Arena 程式設計榜單上以 1679 分登頂,成為首個超越所有閉源模型的開源模型,Artificial Analysis 智能指數綜合排名全球第三。馬斯克本人也在 Kimi K3 相關評測下留言稱「令人印象深刻」。業內普遍解讀,xAI 加快 Grok 4.6/4.7 發布節奏,與 OpenAI、Anthropic 及中國廠商的競爭烈度上升直接相關。
爭議點一:時間表未經第三方驗證。目前唯一資訊源是馬斯克在 X 上的一條回覆貼,xAI 官方部落格和產品頁尚未同步公告,實際日期存在提前或推遲的可能。
爭議點二:基準分數與定價全部空白。與 Grok 4.5 發布時詳細的模型卡、基準表不同,Grok 4.6 目前沒有任何獨立測評或官方模型卡佐證其能力,「1.5 萬億參數」和「SFT/RL 大幅升級」目前都是廠商單方面說法。
背景:xAI 內容安全爭議。就在 Grok 4.6 預告前不久,xAI 於 7 月對一名用戶提起訴訟,指控其利用 Grok 繞過安全限制生成兒童性虐待材料(CSAM),這也是 xAI 首次就 AI 生成的深度偽造內容起訴用戶。今年 1 月,Common Sense Media 的報告曾將 Grok 評為「未成年人保護最差的 AI 產品之一」。這些爭議不影響模型本身的技術能力評價,但涉及企業在快速迭代節奏下的安全合規投入,值得關注。
背景:業界「減速」與「加速」的分裂。7 月 28 日——馬斯克發布 Grok 4.6/4.7 路線圖的同一天,OpenAI、Anthropic 等公司 1200 餘名員工聯署了「Pacing the Frontier」公開信,呼籲美國政府建立主動放緩前沿 AI 發展的治理工具,OpenAI 和 Anthropic 均以公司名義背書。xAI 並未出現在簽署名單中。
如果馬斯克的時間表成立,Grok 4.6、Grok 4.7 將與傳聞中的 Claude Fable 5.1 在同一個月內相繼登場,疊加 7 月已經開源的 Kimi K3 帶來的開源模型衝擊,2026 年 8 月很可能成為大模型發布密度最高的月份之一。對開發者和企業用戶而言,這意味著選型窗口期極短——上一代旗艦可能剛上線一個月就要面對新一代競品,性價比和 token 效率(而非單純的參數規模或跑分)會是更實際的決策依據。
要在本地跟蹤多模型 API 切換、Agent 編排管線或 Grok/Cursor 聯合開發工作流,筆電往往面臨進程不穩定、無法 7×24 常駐與編譯負載瓶頸;自建 VPS 又常遇 Apple Silicon 生態缺失與 Metal 編譯鏈不可用。對於需要穩定隔離環境、適合 iOS CI/CD 與 AI Agent 自動化的生產場景,VpsMesh 的 Mac Mini M4 雲端租用通常是更優解:統一記憶體適合大上下文 Agent 編排,遠端節點可 7×24 承載多模型路由測試而不污染本機環境。詳情可見 Mac Mini M4 租用定價。
馬斯克表示「大約 8 月 7 日」,但這是非正式表態,並非 xAI 官方確認的發布日期,實際時間可能提前或延後。建議關注 xAI 官方 X 帳號與 x.ai 公告。
Grok 4.6 為 1.5 萬億參數,重點是 SFT 與 RL 後訓練升級;Grok 4.7 為 2.1 萬億參數,預計在 4.6 發布後「幾週」跟進,馬斯克稱其能力全面優於 4.6,但推理速度略慢,token 效率更高。xAI 似乎在構建「更快」與「更強」兩款 SKU 的分層策略。
目前無法判斷。Grok 4.6 沒有任何公開基準分數,Kimi K3 已有實測數據且在部分程式設計榜單上表現突出,Claude Fable 5.1 本身尚未被 Anthropic 官方確認發布,三者暫無法直接對比。可參考本站 Kimi K3 全面開源解析了解競品現狀。
官方未公布。可參考 Grok 4.5 的定價(輸入 $2 / 輸出 $6,每百萬 token)作為大致區間,但新一代模型定價可能調整,務必以正式發布資訊為準。若需部署 Agent 測試環境評估成本,可查看 幫助中心相關說明。
按 Grok 4.5 的分發路徑推測,大概率會先上線 Grok Build、xAI 官方 API 和控制台,隨後逐步接入更多第三方平台(如 Cursor),但具體入口以正式發布公告為準。