7 月 28 日馬斯克預告:Grok 4.6 與 4.7 路線圖

2026 年 7 月 28 日,Elon Musk 在 X 回覆 Vercel CEO Guillermo Rauchg(@rauchg)時,首次公開 Grok 4.6 與 4.7 的連續發布計畫。重點如下:

  • Grok 4.6:目標約 8 月 7 日上線,參數規模約 1.5 萬億(1.5T),訓練重心放在 SFT(監督微調)與 RL(強化學習)後訓練階段,而非單純擴大預訓練算力。
  • Grok 4.7:預計在 4.6 發布數週後推出,參數升至約 2.1 萬億(2.1T);馬斯克表示整體能力會更好,但推理服務速度可能較慢,同時token 效率(完成相同任務所需 token 數)預期更佳。
  • 馬斯克時間:馬斯克在回覆中未給出精確 SLA,社群慣以「馬斯克時間」看待其公開日期——歷史上 xAI 產品節點常有一至兩週浮動,8 月 7 日應視為目標窗口而非合約承諾。

同日(7 月 28 日),1100 餘名 OpenAI、Anthropic、Google 等員工聯署《Pacing the Frontier》公開信,呼籲政府牽頭「刻意放緩」前沿 AI 自動化研發——與 xAI 兩週一版的發布節奏形成鮮明對照。

前沿模型輪換下,工程團隊面臨的摩擦點

Grok 4.5 上線僅三週即預告兩個後繼版本,對正在鎖定基準與合約的團隊而言,以下限制在七月末變得更加具體:

  • 基準快速過期:7 月 8 日 Grok 4.5 的 Terminal-Bench 2.1(83.3%)與 SWE-Bench Pro(64.7%)剛成為對照標竿,8 月初 4.6 上線後既有跑分可能在一個月內失去參考價值。
  • 服務速度與 token 效率的權衡:4.7 預告「整體更好但 serving 較慢、token 效率更佳」——若你的產品按 token 計費或對延遲敏感,需在 4.6 與 4.7 之間重新評估成本模型,而非盲目追最新版。
  • 合規與聲譽風險:2026 年 7 月 xAI 面臨 CSAM(兒童性虐待素材)相關訴訟,企業採購 Grok API 時須將內容安全與供應商盡職調查納入決策,尤其涉及面向終端用戶的 agent 產品。
  • 競品同步升級:Kimi K3 於 7 月 16–26 日釋出 2.8T MoE 開放權重、1M 上下文,Artificial Analysis Intelligence Index 排名第三;Claude Fable 5.1 傳聞八月發布但尚未確認——單押 Grok 的風險在放大。
  • 多供應商路由複雜度:若已透過 OpenRouter 統一呼叫 Grok、Kimi、Claude 等模型,兩週內連續新增 4.6 與 4.7 意味著路由表、Fallback 鏈與 A/B 測試腳本須同步維護。
  • 本地 Agent 環境污染:Grok 4.5 與 Cursor 聯合訓練,許多團隊已在 Cursor 內嵌 Grok 做 agentic 開發;模型版本切換時,舊版快取、MCP 設定與測試 fixture 若未隔離,容易得出不可重現的評估結果。

Grok 4.5 / 4.6 / 4.7 路線對照

在 4.6 正式上線前,以已確認的 4.5 規格與馬斯克 7 月 28 日預告為基礎,整理三代差異:

維度 Grok 4.5(已上線) Grok 4.6(預告) Grok 4.7(預告)
預計上線2026 年 7 月 8 日約 2026 年 8 月 7 日4.6 後數週
參數規模未公開完整規模約 1.5T約 2.1T
訓練重點Coding / agentic、Cursor 聯合訓練SFT / RL 後訓練強化更大參數 + 更佳 token 效率
上下文500K token待官方確認待官方確認
API 定價輸入 $2 / 輸出 $6 每百萬 token待官方確認待官方確認
已知基準Terminal-Bench 2.1 83.3%;SWE-Bench Pro 64.7%
服務特性現行 serving 速度能力更強但 serving 可能較慢

七月前沿模型橫向對照:Grok、Kimi K3 與 Claude 傳聞

若你的選型矩陣涵蓋閉源 API 與開放權重,以下對照有助於在 8 月窗口前鎖定評估優先序:

模型 狀態 參數 / 架構 上下文 關鍵指標
Grok 4.5已上線(7/8)500KTerminal-Bench 2.1 83.3%;SWE-Bench Pro 64.7%
Grok 4.6預告 ~8/7~1.5T,SFT/RL待確認
Grok 4.7預告 4.6 後數週~2.1T待確認更佳 token 效率;serving 可能較慢
Kimi K37/16–26 開放權重2.8T MoE1MFrontend Code Arena 1679;AA Index #3
Claude Fable 5.1傳聞八月,未確認

回顧 Grok 4.5:七月已上線的 agentic 基準

在評估 4.6 之前,須先理解 4.5 為何成為當前 xAI 的 coding 旗艦:

  • 發布日期:2026 年 7 月 8 日,距 4.6 預告僅約三週。
  • 定位:專注 coding 與 agentic 任務,與 Cursor 聯合訓練,已整合進 Cursor IDE 與 GitHub Copilot 模型選擇器。
  • 上下文與定價:500K token 上下文;API 定價為輸入每百萬 token $2、輸出 $6
  • 公開基準:Terminal-Bench 2.1 得分 83.3%;SWE-Bench Pro 得分 64.7%——在 agentic 終端操作與真實軟體工程修復場景均屬前沿水準。

判斷:4.5 已證明 xAI 在 coding/agentic 軸線具競爭力;4.6 的 SFT/RL 強化意味對齊品質與指令遵循可能跳升,但參數 1.5T 相對 4.7 的 2.1T 可能是「快速迭代版」——若你對延遲與成本敏感,不宜在 4.6 剛上線就全面遷移,應等 4.7 規格明朗後再定版。

八月 Grok 4.6 評估六步實操指南

以下六步協助你在「馬斯克時間」與競品同步升級的夾縫中,建立可重現的評估流程:

  1. 鎖定 Grok 4.5 基準:在 4.6 上線前,用你實際的 agent 任務(修 bug、跑測試、重構模組)在 Grok 4.5 上記錄 token 用量、延遲與成功率,作為 4.6 對照的「零日基線」。
  2. 建立 OpenRouter 多模型路由:OpenRouter 指南設定 Grok 4.5 為主路由、Kimi K3 為長上下文備援,預留 4.6 model ID 占位,避免上線當天臨時改程式碼。
  3. 預留 8/7 起兩週緩衝窗口:將 8 月 7 日至 8 月 21 日設為評估期,涵蓋「馬斯克時間」可能的延遲與 4.7 預告窗口,不在首日就切換生產流量。
  4. 分離 Cursor / Agent 測試環境:Grok 4.5 與 Cursor 深度整合,版本切換時須在獨立工作區測試 MCP 工具鏈與快取行為,避免污染主力開發機的 DerivedData 與全域設定。
  5. 對照 Kimi K3 開放權重基準:若團隊具備 GPU 叢集或走 Moonshot API,用 K3 的 Frontend Code Arena 1679 與 AA Index #3 作為獨立驗證軸,避免只看 xAI 自家基準。
  6. 追蹤合規與定價變動:監看 xAI CSAM 訴訟進展與 API changelog;若 4.6/4.7 調整定價或限流,在合約中預留價格保護條款並更新內部成本模型。

可引用的硬核數據與官方來源

  • Grok 4.5 Terminal-Bench 2.1 83.3%:agentic 終端操作基準,反映模型在真實 shell 環境的任務完成率——來源:xAI Grok 4.5 官方發布。
  • Grok 4.5 SWE-Bench Pro 64.7%:真實 GitHub issue 修復場景基準,與 Cursor 聯合訓練成果直接相關——來源:xAI Grok 4.5 官方發布。
  • Kimi K3 Frontend Code Arena 1679、AA Index #3:7 月 16–26 日開放權重後的獨立第三方排名,2.8T MoE、1M 上下文——來源:Moonshot 與 Artificial Analysis。
  • Grok 4.6 ~8/7、4.7 數週後:1.5T SFT/RL 與 2.1T 路線——來源:馬斯克 2026 年 7 月 28 日 X 回覆 @rauchg。

模型發布時程、定價與基準數字可能隨 xAI 官方公告調整,請以下列一手來源為準。

以下為 xAI Grok 4.5 官方發布頁:

xAI — Introducing Grok 4.5

以下為 Tron Weekly 對馬斯克 2026 年 7 月 28 日 X 帖子的報導(含原文引用):

Tron Weekly — Elon Musk Targets August 7 For Grok 4.6

以下為 Moonshot Kimi K3 權重與技術規格:

Hugging Face — moonshotai/Kimi-K3

Grok 4.6 常見問題

Grok 4.6 什麼時候發布?

馬斯克於 2026 年 7 月 28 日在 X 回覆 @rauchg 時表示,Grok 4.6 預計約在 8 月 7 日前後上線,參數約 1.5 萬億,重點強化 SFT 與 RL 後訓練。但須預留「馬斯克時間」一至兩週緩衝。

Grok 4.6 與 4.5 有何差異?

4.5(7 月 8 日)主打 coding/agentic、Cursor 聯合訓練,500K 上下文,定價輸入 $2、輸出 $6 每百萬 token。4.6 參數升至約 1.5T,訓練重心轉向 SFT/RL 對齊,預期在指令遵循與對話品質上跳升。

Grok 4.7 會比 4.6 更好嗎?

馬斯克預告 4.7 參數約 2.1T,整體能力優於 4.6,但推理服務速度可能較慢;同時 token 效率預期更好——相同任務可能消耗更少 token,實際成本需上線後實測。

馬斯克公布的時程可靠嗎?

社群慣稱「馬斯克時間」——公開日期多為目標而非 SLA。建議以 8 月 7 日為評估起點、預留一至兩週緩衝,並以 xAI 官方 API changelog 與新聞稿為準,勿在預告當日就切換生產流量。

Grok 4.6 與 4.7 的連續預告,意味著八月每一週都可能是新的模型基準日——在 Cursor agent、xAI API 與多供應商路由之間反覆切換,最需要的是一台可隨時清空、不受主力機污染的 Apple Silicon 硬體:隔離 MCP 設定、重跑 SWE-Bench 風格任務、對照 Kimi K3 與 Grok 回應而不留下 SDK 殘留。KVMFLUX 按天起租的雲端 Mac mini提供 Root 級權限與 SSH 雙通道,讓你在 8 月評估窗口內建立乾淨的 agent 測試環境,測完即退、不留衝突。若你正在評估租期,按天方案最適合這類模型發布驅動的快速驗證週期。

在真實 Apple Silicon 上評估 Grok Agent 工作流

按天租用 Mac mini M4,跑 Grok API 與 Cursor agent 整合測試,八月模型窗口內快速驗證完就退租——不污染你的主力開發機。

Mac Mini M4 · 16GB / 256GB
按天$19.3 /天
按週$52.2 /週
按月$96.7 /月
按季$263 /季