Mercury 2
Mercury 2 是 Inception 的扩散语言模型,也是把该公司「并行解码」路线真正推进生产使用的一次发布。Inception 在 2026 年 2 月推出它,官方博客把卖点写得很清楚:这是一条不一样的曲线,而不只是一个更高的分数。自回归模型逐个 token 从左写到右,Mercury 一次生成一大片再由少几步迭代收敛,官方形容它更像编辑改稿,而不是打字机。
这一点在循环里最值钱。生产环境的 Agent、检索管线、抽取任务,每个任务要调用几十次模型,延迟会在每一步、每个用户、每次重试上叠加。Mercury 2 的主张是:把推理级质量塞进实时延迟预算里,你能跑得起的步数就变了。
Mercury 2 已被 Mercury 2.5 接替,后者于 2026-09-08 发布,上下文扩大到 260K。Mercury 2 目前仍以同样的标价在 API 上提供,也仍是第三方延迟评测最常引用的那一版。
模型规格
| 规格 | Mercury 2 |
|---|---|
| 架构 | 扩散语言模型(dLLM) |
| 上下文窗口 | 128K token(chat) |
| 最大输出 | 50,000 token |
| 输入 / 输出 | 文本 |
| 推理 | reasoning effort 可调 |
| 接口 | v1/chat/completions |
| 能力 | 工具调用、结构化输出 |
| 发布时间 | 2026 年 2 月 |
定价
Inception 官方文档给出的 Mercury 2 价格:
| 项目 | 价格 |
|---|---|
| 输入 | $0.25 / 百万 token |
| 缓存输入 | $0.025 / 百万 token |
| 输出 | $0.75 / 百万 token |
Mercury 2 今天没有促销价,Inception 目前宣传的 8 折优惠只针对 Mercury 2.5。Mercury 2 兼容 OpenAI API,把现有客户端指向 https://api.inceptionlabs.ai/v1 属于改配置,不是重写代码。
第三方评测怎么说
Artificial Analysis 在 2026-09-25 的页面把 Mercury 2 的发布月份标为 2026 年 2 月,并已把它标记为 deprecated,建议改用 Mercury 2.5。但它实测的数字仍是最好用的参照:
- 速度:每秒 761.4 个输出 token,在 174 个模型中排第 3。
- 智能:Artificial Analysis 智能指数 14 分,174 个模型中排第 77,高于中位数 13。
- 价格:输入 $0.25、输出 $0.75,缓存折扣 90%。
- 上下文:128K token,纯文本输入输出。
Inception 自己宣称在 NVIDIA Blackwell 上能跑到每秒 1,009 token,第三方实测 761,这个差距是常见的厂商数据与跑分差异。看趋势即可,不必纠结具体数值。
速度用在了哪里
官方发布文里收集了一批生产案例,都是厂商自述,当作方向性参考:
- Zed 用它做 next-edit 建议与重构,开发者一旦等待就会断掉心流。
- Wispr Flow 用它做实时转写清理与交互式应用。
- Skyvern 表示 Mercury 2 至少比 GPT-5.2 快一倍,称这对浏览器自动化是改变游戏规则的一件事。
- Viant 用它优化由几十次链式推理组成的广告投放执行。
- SearchBlox 在客服、合规、电商搜索上跑亚秒级智能。
- OpenCall 的语音 Agent 报告模型响应延迟中位数接近 170 毫秒。
NVIDIA 的 Shruti Koparkar 也在文中背书,把这项跑分和 Blackwell 基础设施绑在一起。
快速开始
- 在 Inception 控制台创建 API key,导出为环境变量
INCEPTION_API_KEY。 - 请求
https://api.inceptionlabs.ai/v1/chat/completions,model填mercury-2,并带上reasoning_effort与max_completion_tokens上限。 - 找出管线里重复最多的调用:路由、上下文压缩、查询改写、重排、工具结果摘要。这些才是快模型划算的地方。
- 比较改动前后的「每任务」端到端延迟与成本,而不是单次调用的数字。
限制与风险
- 已被接替。 Mercury 2.5 的上下文翻倍、智能指数更高,还有促销价。新接入应该直接用它。
- 智能不是第一梯队。 智能指数 14 分高于平均,但不是前沿模型。硬推理仍应交给前沿模型。
- 纯文本、128K 上下文。 不支持图像与音频输入,500K 到 1M token 的长上下文任务需要换模型。
- 速度是厂商自述。 每秒 1,009 token 是 Inception 自己的测量。
- 输出上限。 单次请求最多 50,000 个输出 token,Mercury 2.5 是 65,536。
常见问题
Mercury 2.5 出来了,Mercury 2 还能用吗?
能。Inception 仍在 v1/chat/completions 上以 $0.25 / $0.75 每百万 token 提供它,Artificial Analysis 也继续为默认负载做速度评测。
需要换客户端吗?
不需要。它兼容 OpenAI API,多数 SDK 只要改 base URL 和模型名。
扩散语言模型是什么?
大多数 LLM 按顺序一次解一个 token;扩散语言模型并行生成一批 token,再用几步迭代收敛。这就是 Inception 敢说「曲线不同」而不只是「硬件更快」的原因。
能替代前沿模型吗?
不能。它的价值是围绕那个贵调用的一圈高频调用的吞吐与成本,而不是难题上的最终答案质量。
替代方案
- Mercury 2.5:接替者,260K 上下文,当前的折扣也在它身上。
- Claude Opus 5.5:质量比延迟更重要的调用交给它。
- Grok 4.7:同代选项之一,上下文窗口大得多。
使用技巧
- 把系统提示词和稳定的长上下文放在请求最前面,吃满 90% 的缓存折扣。
- 路由、分类这类调用把 reasoning effort 调低,可调的推理档位是成本曲线保持平坦的关键。
- 正式接入前先和 Mercury 2.5 做一次对比,接替者在性价比上更划算。
总结
Mercury 2 证明了扩散语言模型能扛真实生产流量,而不只是赢一个延迟榜,Zed、Skyvern、SearchBlox 的案例就是证据。它已经不是起步首选,因为 Mercury 2.5 出现了;但如果你已经在跑它,或者想看清这场速度论证从哪里开始,它依然值得留在词条库里。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。