Grok 4.6 于 2026 年 8 月 12 日由 SpaceXAI(原 xAI)发布,是该公司的最新前沿推理模型。它基于与 Grok 4.5 相同的 1.5 万亿参数 V9 基座,但提升主要来自大幅重构的后训练流程,而非单纯扩大规模,重心从原始智能转向长时间运行的智能体与交互式、视觉化工作:多步研究、代码库导航,以及把产品想法变成打磨完善的应用程序。
模型规格
| 规格 | Grok 4.6 |
|---|---|
| 参数 | 1.5T(V9 基座) |
| 上下文长度 | 500,000 token |
| 模态 | 文本 + 图像输入;文本输出 |
| 推理强度 | low、medium、high(默认)、xhigh |
| API 兼容性 | 兼容 OpenAI SDK(Responses + Chat Completions) |
| 可用渠道 | Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare |
| 协议 | 闭源权重 |
相比 Grok 4.5 的新变化
- 后训练重构:同样的 1.5T V9 基座,但 SFT 与强化学习显著改进,训练覆盖了知识工作、通用编码、Web 开发、CAD 与内核优化等智能体 RL 任务。
- 自我验证行为:在多步任务中,模型越来越多地先测试和验证自己的输出,再继续推进。
- 更强的首次尝试:在视觉与交互式项目上,它能先根据产品想法搭建应用的结构与视觉语言,再做细化。
- 更长的补充训练:使用模型生成的推理数据与工程材料进行了更长时间的补充训练。
基准亮点(官方自报)
- AA 智能指数:61(Grok 4.5 为 56)
- APEX-Agents:57.5%(此前为 47.1%)
- DeepSWE v1.1:65.9%(此前为 54%)
- CursorBench v3.2:69.9%(此前为 66.7%)
- Harvey LAB (Vals):15.8%,对比组中专业/法律工作得分最高
- 已知短板:Terminal-Bench v3.0 仅 26%,落后于对手(34-35%),真实终端工作上存在切实差距
定价
| 档位 | 输入 / 百万 token | 缓存输入 / 百万 token | 输出 / 百万 token |
|---|---|---|---|
| < 200K prompt token | $2.00 | $0.50 | $6.00 |
| ≥ 200K prompt token | $4.00 | $1.00 | $12.00 |
| Fast 变体 | 标准价 2 倍 | 标准价 2 倍 | 标准价 2 倍 |
消费级套餐包括限量免费档、$30/月的 SuperGrok、$100/月的 SuperGrok Plus 与 $300/月的 SuperGrok Heavy。按每百万 token $2/$6 计算,Grok 4.6 的价格约为 Claude Opus 5($5/$25)、GPT-5.6 Sol($5/$30)等同级前沿模型的一半。
注意事项
所有基准均为 SpaceXAI 官方自报,尚无独立复现。1.5T 参数规模来自 Elon Musk 的 X 帖子,而非正式模型卡。后续型号 Grok 4.7(2.1T 参数)预计于 2026 年 8 月底或 9 月初发布。
总结
Grok 4.6 表明,xAI 的竞争力已从单纯的模型规模转向智能体训练与交互式工作。对智能体开发者与重度编码用户而言,它以约为主流对手一半的 API 成本提供了前沿级能力,实时 X 数据接入仍是其标志性差异点。
评论
还没有评论。成为第一个评论的人!
相关工具
Grok
x.ai
xAI 的前沿多模态 AI 模型,具有实时 X 数据访问、100 万 token 上下文、Aurora 图像生成和行业领先的推理能力。
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic 前沿 Opus 级模型,1M token 上下文与可调思考强度,以 Opus 4.8 的价格带来接近 Fable 5 的智能水平,适合智能体与长周期编码任务。
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。