若你是正在跟踪 xAI Grok 系列发布节奏、评估 Agent 编程模型选型的开发者或技术决策者,马斯克 7 月 28 日在 X 上回复 Vercel CEO Guillermo Rauch 时透露的路线图,很可能影响你接下来两个月的模型栈规划。Grok 4.6 预计 8 月 7 日前后发布,参数规模 1.5 万亿,几周后还将推出 2.1 万亿参数的 Grok 4.7——距 Grok 4.5 上线仅一个月。本文覆盖时间线、核心数据表、SFT/RL 升级逻辑、与 Kimi K3 及 Claude Fable 5.1 的横向对比、争议点与六步发布前准备清单;可与 Grok 4.5 评测篇、Kimi K3 开源解读 交叉阅读。定价见 定价页。
[ SECTION_01 ] // TIMELINE Grok 4.5 到 4.6、4.7:节奏有多快?哪些信息仍待官方确认?
目前官方尚未公布 Grok 4.6 的具体基准分数和定价,以下信息基于马斯克本人的公开表态及行业报道整理,发布前务必以 xAI 官方渠道核实。
- 单一信息源风险:目前唯一一手来源是马斯克 7 月 28 日的一条 X 回复,xAI 官方博客与产品页尚未同步公告,实际日期存在提前或推迟的可能。
- 「Musk time」弹性:xAI、Tesla、SpaceX 的历史时间表常有数天到数周的偏差,「大约 8 月 7 日」应视为目标而非承诺。
- 基准与定价空白:与 Grok 4.5 发布时详细的模型卡、15 项基准不同,Grok 4.6 目前没有任何独立测评或官方模型卡佐证其能力。
- 竞品挤压窗口:Grok 4.6 目标日期卡在 Kimi K3 全面开源约 10 天后,开源模型在编程榜单的冲击已迫使 xAI 压缩迭代节奏。
- 行业节奏分裂:7 月 28 日同日,OpenAI、Anthropic 等 1200 余名员工联署「Pacing the Frontier」公开信呼吁放缓前沿 AI 发展,xAI 未出现在签署名单中。
- 安全合规背景:7 月 xAI 首次就用户绕过安全限制生成 CSAM 内容起诉用户,Common Sense Media 1 月报告曾将 Grok 评为未成年人保护最差的 AI 产品之一。
核心结论:Grok 4.6 的「1.5 万亿参数」与「SFT/RL 大幅升级」目前均为厂商单方面说法;在模型卡落地前,任何选型决策都应保留 Kimi K3、Claude Fable 5.1 等备选路由。
关键时间线:
- 2026年7月8日:xAI 正式发布 Grok 4.5,定位为「专为编程与智能体任务打造」的旗舰模型,与 Cursor 合作、使用真实开发者会话数据训练,支持 50 万 token 上下文,定价为每百万 token 输入 2 美元/输出 6 美元。
- 2026年7月16日:竞品 Moonshot AI 的 Kimi K3 以托管服务形式上线。
- 2026年7月26日:Kimi K3 提前一天放出完整开源权重,2.8 万亿参数、100 万 token 上下文。
- 2026年7月28日:马斯克在回复 Rauch 的帖子中首次公开 Grok 4.6 和 4.7 的路线图与大致时间表。
- 约2026年8月7日(目标):Grok 4.6 计划发布,1.5 万亿参数,重点在 SFT 与 RL 层面的升级。
- 约2026年8月末至9月初(预估):Grok 4.7 计划跟进,2.1 万亿参数,马斯克称其「除了推理速度稍慢外,其他方面全面优于 4.6,且 token 效率更高」。
[ SECTION_02 ] // SPECS_SFT_RL 核心数据一览:这次升级的重点不是「更大」,而是「更会学」
| 模型 | 发布/目标时间 | 参数规模 | 定位重点 | 状态 |
|---|---|---|---|---|
| Grok 4.3 Beta | 2026年4月17日 | 未公开 | 上一代基线 | 已发布 |
| Grok 4.5 | 2026年7月8日 | 未公开(非 MoE 单一 SKU) | 编程与智能体,与 Cursor 联合训练 | 已发布 |
| Grok 4.6 | 约2026年8月7日 | 1.5万亿 | SFT/RL 大幅升级 | 官方预告,未发布 |
| Grok 4.7 | 约8月末-9月初 | 2.1万亿 | 全面优于 4.6,token 效率更高 | 官方预告,未发布 |
注:参数规模、定价、基准分数均为厂商/马斯克自述,Grok 4.6 与 4.7 目前均未有第三方独立评测数据,表中「官方预告」信息务必以正式发布为准。
监督微调(SFT)与强化学习(RL)在解决什么问题:SFT 用人工标注或精选的高质量样本纠正模型输出习惯;RL 用奖励信号让模型在真实任务链路中学会「怎么做才对」,尤其是多步骤的智能体任务。马斯克特意强调 Grok 4.6 的升级重点在「SFT & RL」而非参数规模本身,这与 Grok 4.5 的打法延续——Grok 4.5 凭借与 Cursor 合作获取的真实开发者会话数据,在保持较小输出 token 消耗的情况下拿到了 Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7% 的成绩,处理同类任务所用的输出 token 数量远低于 Claude Opus 4.8(约 1.9 万 token 对 6.7 万 token)。
xAI「参数堆量 + 后训练精修」双轨策略:Grok 4.6 的 1.5 万亿参数相比 Grok 4.5 是明显的规模跃升,但马斯克随后补充 Grok 4.7 会更大(2.1 万亿)却「推理稍慢」,暗示 xAI 内部用两款不同定位的模型分别满足「更强」和「更快」的需求,而不是用一个模型通吃所有场景。
与 Kimi K3 同期竞争的现实压力:Kimi K3 在 Frontend Code Arena 编程榜单上以 1679 分登顶,成为首个超越所有闭源模型的开源模型,Artificial Analysis 智能指数综合排名全球第三。马斯克本人在 Kimi K3 相关评测下留言称「令人印象深刻」。业内普遍解读,xAI 加快 Grok 4.6/4.7 发布节奏,与 OpenAI、Anthropic 及中国厂商的竞争烈度上升直接相关。
[ SECTION_03 ] // COMPARE 横向对比:Grok 系列 vs 同期竞品怎么排?
| 模型 | 厂商 | 参数规模 | 上下文窗口 | 定价(输入/输出,每百万 token) | 关键数据来源 |
|---|---|---|---|---|---|
| Grok 4.5 | xAI | 未公开 | 50万 token | $2 / $6 | xAI 官方公告 |
| Grok 4.6(预告) | xAI | 1.5万亿 | 未公开 | 未公开 | 马斯克 X 帖子(未经第三方验证) |
| Kimi K3 | 月之暗面 | 2.8万亿(MoE,激活约16/896专家) | 100万 token | $0.30(缓存命中)/$3(缓存未命中)输入,$15 输出 | Moonshot 官方 + Hugging Face |
| Claude Fable 5.1(传闻) | Anthropic | 未公开 | 未公开 | 传闻维持 Fable 5 定价($10 输入/$50 输出) | 36kr、WinCentral 爆料,Anthropic 未确认 |
| GPT-5.6 Sol | OpenAI | 未公开 | 未公开 | 未公开 | OpenAI 官方公告 |
表格中 Grok 4.6、Claude Fable 5.1 相关数据均为预告或传闻,不构成正式基准对比,仅供参考发布节奏和大致定位。
如果马斯克的时间表成立,Grok 4.6、Grok 4.7 将与传闻中的 Claude Fable 5.1(据 36kr、WinCentral 等多方爆料指向 8 月,且 Anthropic 意图抢在 OpenAI GPT-6 之前上线)在同一个月内相继登场,叠加 7 月已经开源的 Kimi K3 带来的开源模型冲击,2026 年 8 月很可能成为大模型发布密度最高的月份之一。对开发者和企业用户而言,选型窗口期极短——上一代旗舰可能刚上线一个月就要面对新一代竞品,token 效率与真实任务成本(而非单纯的参数规模或跑分)会是更实际的决策依据。
[ SECTION_04 ] // PREP_STEPS Grok 4.6 发布前六步工程准备清单
- 锁定官方信息源:订阅 xAI 官方博客、X 账号 @xai 与 @elonmusk,在 Grok Build 与 API 控制台开启公告通知;在正式发布前不把马斯克推文当作 SLA 承诺。
- 建立 Grok 4.5 成本基线:统计当前 Agent 工作流在 Grok 4.5 上的输入/输出 token 分布与账单,记录 SWE-Bench Pro 类任务的平均输出 token(官方披露约 1.9 万/任务),为 4.6 定价变动预留 20%–40% 缓冲。
- 梳理 SFT/RL 升级对 Agent 链路的影响:列出多步骤 Coding Agent 的关键失败模式(工具调用幻觉、上下文截断、长链路奖励稀疏),标记哪些步骤可能从 4.6 的后训练升级中受益,哪些仍需人工审核兜底。
- 预设分层路由预案:日常批处理保留 Kimi K3 或 DeepSeek V4 Flash 跑量;复杂推理步骤预留 Claude Fable 5.1 / GPT-5.6 Sol 切换位;Grok 4.6 上线后先在非生产环境 A/B 对比 token 效率。参见 OpenRouter 7 月分层选型。
- 在 Cursor / API 客户端预留接入位:按 Grok 4.5 的分发路径,提前在 Cursor、OpenRouter 或直连 xAI API 配置中预留模型 ID 切换逻辑;发布当日只需改 model 字符串而非重构调用链。
- 固化 7×24 macOS Agent 编排环境:模型发布窗口期往往伴随密集回归测试与多模型并行评测,须把 Agent 网关、CI Runner 与评测脚本跑在常驻 macOS 节点;详见 帮助中心 与 订购页。
# 多模型路由环境变量示例(发布前请以 xAI 官方文档核对模型 ID)
GROK_PRIMARY=grok-4.5
GROK_FALLBACK=kimi-k3
GROK_COMPLEX=claude-fable-5
XAI_API_BASE=https://api.x.ai/v1
# Grok 4.6 上线后:GROK_PRIMARY=grok-4.6
[ SECTION_05 ] // FACTS_FAQ 可引用硬核数据、FAQ 与 7×24 Agent 宿主收束
- Grok 4.6 目标发布日:马斯克称「大约 8 月 7 日」,非 xAI 官方确认日期(来源:马斯克 2026-07-28 X 帖子)。
- 参数规模:Grok 4.6 预告 1.5 万亿,Grok 4.7 预告 2.1 万亿(来源:同上,未经第三方验证)。
- Grok 4.5 上下文与定价:50 万 token 上下文,输入 $2/输出 $6 每百万 token(来源:xAI 官方 Grok 4.5 模型卡)。
- Grok 4.5 Token 效率:SWE-Bench Pro 任务平均约 1.9 万输出 token,Claude Opus 4.8 约 6.7 万(来源:xAI 模型卡)。
- Grok 4.5 编程基准:Terminal-Bench 2.1 83.3%、SWE-Bench Pro 64.7%(来源:xAI 官方)。
- Kimi K3 编程榜单:Frontend Code Arena 1679 分,Artificial Analysis 智能指数全球第三(来源:Arena.ai / Artificial Analysis)。
- 行业背景:7 月 28 日 1200+ 员工联署「Pacing the Frontier」公开信,OpenAI 与 Anthropic 公司名义背书(来源:The Verge、TechTimes)。
FAQ 精选:
- Q:Grok 4.6 具体是哪天发布?A:马斯克表示「大约 8 月 7 日」,但这是非正式表态,并非 xAI 官方确认的发布日期,实际时间可能提前或延后。
- Q:Grok 4.6 和 Grok 4.7 有什么区别?A:Grok 4.6 为 1.5 万亿参数,重点是 SFT 与 RL 后训练升级;Grok 4.7 为 2.1 万亿参数,预计在 4.6 发布后「几周」跟进,马斯克称其能力全面优于 4.6,但推理速度略慢,token 效率更高。
- Q:Grok 4.6 会比 Kimi K3 或 Claude Fable 5.1 更强吗?A:目前无法判断。Grok 4.6 没有任何公开基准分数,Kimi K3 已有实测数据且在部分编程榜单上表现突出,Claude Fable 5.1 本身尚未被 Anthropic 官方确认发布,三者暂无法直接对比。
- Q:Grok 4.6 大概会怎么定价?A:官方未公布。可参考 Grok 4.5 的定价(输入 $2/输出 $6,每百万 token)作为大致区间,但新一代模型定价可能调整,务必以正式发布信息为准。
- Q:普通用户届时能在哪里用上 Grok 4.6?A:按 Grok 4.5 的分发路径推测,大概率会先上线 Grok Build、xAI 官方 API 和控制台,随后逐步接入更多第三方平台,但具体入口以正式发布公告为准。
下列为撰写时依据的公开来源;若上游更新,请以原文为准。
https://huggingface.co/moonshotai
以上信息截至 2026 年 7 月 30 日,Grok 4.6/4.7 相关细节均为官方预告或行业传闻,发布前请务必以 xAI 官方渠道核实最新数据。
替代方案的真实缺点(工程视角):① 在发布窗口期用个人笔电跑 Grok 4.6 回归测试,合盖 sleep 后 OAuth 与长时 Agent 批任务中断,新模型再强也无法完成 7×24 流水线;② 为抢首发评测一次性买断高配 Mac Studio,而实际推理走 xAI API、本地只需稳定 macOS Agent 编排面,3 个月闲置折旧远高于按周租用;③ 把所有 Agent 工作流锁死在单一 Grok SKU 上,忽略 Kimi K3 开源冲击与 Fable 5.1 传闻的 8 月扎堆发布,选型窗口压缩到数周后才发现 token 效率与账单失控。
对需要独占 Apple Silicon、7×24 在线、按天/周/月弹性扩容、在 macOS 宿主上稳定跑 Grok / Kimi K3 / Claude 多模型路由与 iOS CI 同机验证的开发者与 AI 自动化团队,NOVAKVM 的 Mac Mini 云端裸金属租赁通常是更优解:六地节点、高内存档位、SSH 直连,把云端 API 推理与裸金属 macOS 执行面分层——新模型发布窗口期密集回归而不被笔记本 sleep 中断。请在 NOVAKVM 定价页 对照 M4 Pro 与存储扩容,在 订购页 拉起试验机;远程会话见 帮助中心。