Grok 4.6 于 2026 年 8 月 12 日由 SpaceXAI(原 xAI)发布,是该公司的最新前沿推理模型。它基于与 Grok 4.5 相同的 1.5 万亿参数 V9 基座,但提升主要来自大幅重构的后训练流程,而非单纯扩大规模,重心从原始智能转向长时间运行的智能体与交互式、视觉化工作:多步研究、代码库导航,以及把产品想法变成打磨完善的应用程序。
模型规格
| 规格 | Grok 4.6 |
|---|---|
| 参数 | 1.5T(V9 基座) |
| 上下文长度 | 500,000 token |
| 模态 | 文本 + 图像输入;文本输出 |
| 推理强度 | low、medium、high(默认)、xhigh |
| API 兼容性 | 兼容 OpenAI SDK(Responses + Chat Completions) |
| 可用渠道 | Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare |
| 协议 | 闭源权重 |
相比 Grok 4.5 的新变化
- 后训练重构:同样的 1.5T V9 基座,但 SFT 与强化学习显著改进,训练覆盖了知识工作、通用编码、Web 开发、CAD 与内核优化等智能体 RL 任务。
- 自我验证行为:在多步任务中,模型越来越多地先测试和验证自己的输出,再继续推进。
- 更强的首次尝试:在视觉与交互式项目上,它能先根据产品想法搭建应用的结构与视觉语言,再做细化。
- 更长的补充训练:使用模型生成的推理数据与工程材料进行了更长时间的补充训练。
基准亮点(官方自报)
- AA 智能指数:61(Grok 4.5 为 56)
- APEX-Agents:57.5%(此前为 47.1%)
- DeepSWE v1.1:65.9%(此前为 54%)
- CursorBench v3.2:69.9%(此前为 66.7%)
- Harvey LAB (Vals):15.8%,对比组中专业/法律工作得分最高
- 已知短板:Terminal-Bench v3.0 仅 26%,落后于对手(34-35%),真实终端工作上存在切实差距
定价
| 档位 | 输入 / 百万 token | 缓存输入 / 百万 token | 输出 / 百万 token |
|---|---|---|---|
| < 200K prompt token | $2.00 | $0.50 | $6.00 |
| ≥ 200K prompt token | $4.00 | $1.00 | $12.00 |
| Fast 变体 | 标准价 2 倍 | 标准价 2 倍 | 标准价 2 倍 |
消费级套餐包括限量免费档、$30/月的 SuperGrok、$100/月的 SuperGrok Plus 与 $300/月的 SuperGrok Heavy。按每百万 token $2/$6 计算,Grok 4.6 的价格约为 Claude Opus 5($5/$25)、GPT-5.6 Sol($5/$30)等同级前沿模型的一半。
注意事项
所有基准均为 SpaceXAI 官方自报,尚无独立复现。1.5T 参数规模来自 Elon Musk 的 X 帖子,而非正式模型卡。后续型号 Grok 4.7(2.1T 参数)预计于 2026 年 8 月底或 9 月初发布。
总结
Grok 4.6 表明,xAI 的竞争力已从单纯的模型规模转向智能体训练与交互式工作。对智能体开发者与重度编码用户而言,它以约为主流对手一半的 API 成本提供了前沿级能力,实时 X 数据接入仍是其标志性差异点。
评论
还没有评论。成为第一个评论的人!
相关工具
Grok
x.ai
xAI 的前沿多模态 AI 模型,具有实时 X 数据访问、100 万 token 上下文、Aurora 图像生成和行业领先的推理能力。
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic 前沿 Opus 级模型,1M token 上下文与可调思考强度,以 Opus 4.8 的价格带来接近 Fable 5 的智能水平,适合智能体与长周期编码任务。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
相关洞察
锁死 Codex 的不是模型,是选择器
你已经为 OpenCode Go、Grok、Z.ai 付过钱了,但 Codex 的 picker 默认只露出 GPT。社区项目 codex-router 做的不是再教一遍安装步骤,而是把已经买过的模型能力接回选择器:密钥不出本机,原生 GPT 也不动。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。