开发者现在面临的选型摩擦点
Grok 4.6 尚未发布,但 8 月密集发布窗口已经影响当下的技术决策。以下限制在 Musk 表态后变得更加具体:
- 唯一信息源是一条 X 回复:xAI 官方博客与产品页尚未同步公告,「8 月 7 日」与「1.5 万亿参数」目前都是马斯克单方面说法,存在典型的「Musk time」弹性。
- 基准分数与定价全部空白:与 Grok 4.5 发布时详细的模型卡不同,Grok 4.6 目前没有任何独立测评或官方模型卡佐证其能力。
- 选型窗口极短:Grok 4.5 7 月 8 日才发布,一个月后就要面对 4.6 和 4.7 的双重迭代,上一代旗舰的有效评估周期被压缩到数周。
- 竞品压力同步升温:Kimi K3 全面开源后在 Frontend Code Arena 以 1679 分登顶,马斯克本人也在相关评测下留言称「令人印象深刻」,xAI 加快节奏与行业竞争烈度直接相关。
- 安全合规背景复杂:7 月 xAI 就 CSAM 生成问题起诉用户,Common Sense Media 年初将 Grok 评为未成年人保护最差的 AI 产品之一,企业选型需额外评估供应商风险。
时间线:从 Grok 4.5 到 4.6、4.7,节奏有多快
马斯克 7 月 28 日在 X 上回复 Rauch 的帖子是本文信息的主要来源。以下时间线按公开事件排列:
- 2026 年 7 月 8 日:xAI 正式发布 Grok 4.5,定位为「专为编程与智能体任务打造」的旗舰模型,与 Cursor 合作、使用真实开发者会话数据训练,支持 50 万 token 上下文,定价为每百万 token 输入 2 美元/输出 6 美元。
- 2026 年 7 月 16 日:竞品 Moonshot AI 的 Kimi K3 以托管服务形式上线,随后在 7 月 26 日提前一天放出完整开源权重,2.8 万亿参数、100 万 token 上下文。
- 2026 年 7 月 28 日:马斯克在回复 Rauch 的帖子中首次公开 Grok 4.6 和 4.7 的路线图与大致时间表;同一天 OpenAI、Anthropic 等 1200 余名员工联署「Pacing the Frontier」公开信。
- 2026 年 8 月 7 日前后(目标):Grok 4.6 计划发布,1.5 万亿参数,重点在 SFT 和 RL 层面的升级,而非单纯堆参数。
- 2026 年 8 月末至 9 月初(预估):Grok 4.7 计划跟进,2.1 万亿参数,马斯克称其「除了推理速度稍慢外,其他方面全面优于 4.6,且 token 效率更高」。
马斯克给出的时间表历来存在弹性——业内常称之为「Musk time」,实际发布日期比预告晚几天到两周并不罕见,发布前建议以 xAI 官方账号或官网公告为准。
核心数据一览:Grok 系列与竞品参数对比
| 模型 | 发布/目标时间 | 参数规模 | 定位重点 | 状态 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026年4月17日 | 未公开 | 上一代基线 | 已发布 |
| Grok 4.5 | 2026年7月8日 | 未公开 | 编程与智能体,与 Cursor 联合训练 | 已发布 |
| Grok 4.6 | 约2026年8月7日 | 1.5万亿 | SFT/RL大幅升级 | 官方预告,未发布 |
| Grok 4.7 | 约8月末-9月初 | 2.1万亿 | 全面优于4.6,token效率更高 | 官方预告,未发布 |
参数规模、定价、基准分数均为厂商/马斯克自述,Grok 4.6 与 4.7 目前均未有第三方独立评测数据,表中「官方预告」信息务必以正式发布为准。
深度拆解:这次升级的重点不是「更大」,而是「更会学」
监督微调(SFT)是用人工标注或精选的高质量样本去纠正模型的输出习惯;强化学习(RL)则是用奖励信号让模型在真实任务链路中学会「怎么做才对」,尤其是多步骤的智能体任务。马斯克特意强调 Grok 4.6 的升级重点在「SFT & RL」而非参数规模本身,这与 Grok 4.5 的打法是延续的——Grok 4.5 当时凭借与 Cursor 合作获取的真实开发者会话数据,在保持较小输出 token 消耗的情况下拿到了 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成绩,处理同类任务所用的输出 token 数量远低于 Claude Opus 4.8(约 1.9 万 token 对 6.7 万 token)。
Grok 4.6 的 1.5 万亿参数相比 Grok 4.5 是明显的规模跃升,但马斯克随后补充说 Grok 4.7 会更大(2.1 万亿)却「推理稍慢」,暗示 xAI 内部很清楚参数规模和推理速度之间存在权衡,未来会用两款不同定位的模型分别满足「更强」和「更快」的需求。
Grok 4.6 的发布时间表恰好卡在 Kimi K3 全面开源引发行业震动之后的第 10 天左右。Kimi K3 在 Frontend Code Arena 编程榜单上以 1679 分登顶,成为首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数综合排名全球第三。
横向对比:Grok 系列 vs 同期竞品定价与规格
| 模型 | 厂商 | 参数规模 | 上下文窗口 | 定价(输入/输出,每百万token) | 数据来源 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 未公开 | 50万token | $2 / $6 | xAI官方公告 |
| Grok 4.6(预告) | xAI | 1.5万亿 | 未公开 | 未公开 | 马斯克X帖子(未经第三方验证) |
| Kimi K3 | 月之暗面 | 2.8万亿(MoE) | 100万token | $0.30/$3 输入,$15输出 | Moonshot官方 |
| Claude Fable 5.1(传闻) | Anthropic | 未公开 | 未公开 | 传闻维持Fable 5定价 | 36kr、WinCentral爆料,未确认 |
| GPT-5.6 Sol | OpenAI | 未公开 | 未公开 | 未公开 | OpenAI官方公告 |
表格中 Grok 4.6、Claude Fable 5.1 相关数据均为预告或传闻,不构成正式基准对比,仅供参考发布节奏和大致定位。
争议点与需要注意的细节
- 时间表本身未经第三方验证:目前唯一信息源是马斯克在 X 上的一条回复贴,xAI 官方博客和产品页尚未同步公告。
- 基准分数与定价全部空白:「1.5 万亿参数」和「SFT/RL 大幅升级」目前都是厂商单方面说法。
- xAI 近期的内容安全争议:7 月 xAI 起诉一名用户利用 Grok 绕过安全限制生成 CSAM,今年 1 月 Common Sense Media 将 Grok 评为「未成年人保护最差的 AI 产品之一」。
- 与行业「减速」呼吁的错位:7 月 28 日 OpenAI、Anthropic 等 1200 余名员工联署「Pacing the Frontier」公开信,xAI 并未出现在签署名单中。
发布前六步评估指南:如何在 Grok 4.6 上线时快速做出决策
在官方模型卡缺席的窗口期,以下六步帮助你在 8 月发布潮中保持理性选型节奏:
- 建立 Grok 4.5 基线:在 Grok Build 或 Cursor 中跑一组你业务相关的 agent 任务,记录 token 消耗、延迟与成功率,作为 4.6 发布后的对照基准。
- 订阅 xAI 官方渠道:关注 xAI 官方 X 账号与 x.ai 博客,避免仅依赖二手报道;马斯克 X 帖子可作为早期信号,但以官方模型卡为准。
- 对比已发布竞品的实测数据:用 OpenRouter 或直连 API 对 Kimi K3、Grok 4.5、GPT-5.6 Sol 跑同一套评测脚本,建立多供应商横向基线。
- 在隔离环境搭建评测流水线:agent 基准测试会安装大量依赖、修改系统配置,应在可重置的 macOS 环境中运行,避免污染主力开发机。
- 预留 API 预算缓冲:参考 Grok 4.5 的 $2/$6 定价作为区间估计,但为 4.6 可能的价格调整预留 20–30% 缓冲,并在合约中保留切换供应商的退出条款。
- 设置 8 月 7 日前后重新评估节点:将 8 月 7 日、8 月 21 日(4.7 预估窗口)设为日历提醒,届时对照官方模型卡重新跑基准,而非在预告阶段就锁定长期架构。
可引用的硬核数据与官方来源
- Grok 4.5 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%:来源 xAI 官方 Grok 4.5 模型卡,处理同类任务输出 token 约 1.9 万,远低于 Opus 4.8 的 6.7 万。
- Kimi K3 Frontend Code Arena 1679 分:首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数全球第三——来源 Moonshot AI 官方发布。
- Grok 4.6 1.5 万亿参数、8 月 7 日目标:来源马斯克 2026 年 7 月 28 日 X 回复 @rauchg,未经 xAI 官方公告确认。
- Grok 4.7 2.1 万亿参数:同上,马斯克称「全面优于 4.6,推理稍慢,token 效率更高」。
以上信息截至 2026 年 7 月 30 日,Grok 4.6/4.7 相关细节均为官方预告或行业传闻,发布前请务必以 xAI 官方渠道核实最新数据。
以下为 xAI 官方 Grok 4.5 发布公告:
以下为 Tron Weekly 对马斯克 2026 年 7 月 28 日 X 帖子的报道(含原文引用):
Tron Weekly — Elon Musk Targets August 7 For Grok 4.6
以下为 Moonshot AI Kimi K3 官方发布页:
Hugging Face — moonshotai/Kimi-K3
Grok 4.6 发布日期常见问题
Grok 4.6 具体是哪天发布?
马斯克表示「大约 8 月 7 日」,但这是非正式表态,并非 xAI 官方确认的发布日期,实际时间可能提前或延后。
Grok 4.6 和 Grok 4.7 有什么区别?
Grok 4.6 为 1.5 万亿参数,重点是 SFT 与 RL 后训练升级;Grok 4.7 为 2.1 万亿参数,预计在 4.6 发布后「几周」跟进,马斯克称其能力全面优于 4.6,但推理速度略慢,token 效率更高。
Grok 4.6 会比 Kimi K3 或 Claude Fable 5.1 更强吗?
目前无法判断。Grok 4.6 没有任何公开基准分数,Kimi K3 已有实测数据且在部分编程榜单上表现突出,Claude Fable 5.1 本身尚未被 Anthropic 官方确认发布,三者暂无法直接对比。
Grok 4.6 大概会怎么定价?
官方未公布。可参考 Grok 4.5 的定价(输入 $2/输出 $6,每百万 token)作为大致区间,但新一代模型定价可能调整,务必以正式发布信息为准。
普通用户届时能在哪里用上 Grok 4.6?
按 Grok 4.5 的分发路径推测,大概率会先上线 Grok Build、xAI 官方 API 和控制台,随后逐步接入更多第三方平台,但具体入口以正式发布公告为准。
8 月可能是 2026 年大模型发布密度最高的月份之一——Grok 4.6、Grok 4.7 与传闻中的 Claude Fable 5.1 扎堆登场,叠加 Kimi K3 的开源冲击,开发者需要在极短的窗口内反复跑 agent 基准与 API 对比。这类测试会快速污染主力机的环境:冲突的 SDK 版本、残留的后台 agent 进程、被改写的系统配置。KVMFLUX 按天起租的云端 Mac mini提供 Root 级权限、SSH + VNC 双通道与独享物理 M4 硬件,让你在 8 月发布潮前建立干净的评估环境,测完即退、不留残留。若你正在评估租期,按天租用最适合这类模型发布驱动的快速验证周期。
在真实 Apple Silicon 上评估 Grok agent 工作流
按天开一台 Mac mini M4,跑 Grok 4.5 基线对比与 Cursor agent 测试,8 月发布窗口内快速验证完就退租。