Mercury 2.5
Mercury 2.5 是 Inception 的第三代生产模型,也是这家公司目前最强的扩散语言模型(dLLM),发布于 2026-09-08。技术赌注从 Inception 的第一代 Mercury 起就没变过:不是逐 token 顺序生成,而是并行起草并反复精修多个 token。Inception 称这是迄今训练过的最大扩散语言模型,目标场景是「延迟本身就是产品」的负载,比如搜索流水线、语音智能体和编码子智能体。
模型规格
| 规格 | Mercury 2.5 |
|---|---|
| 架构 | 扩散语言模型(dLLM) |
| 上下文窗口 | 260K tokens |
| 输入 | 文本 |
| 输出 | 文本 |
| 推理 | 可调推理强度 |
| 工具调用 | 并行工具调用、符合 schema 的 JSON |
| 速度 | 1,107 tokens/秒 |
| 发布时间 | 2026-09-08 |
260K 上下文在 2026 年属于中位水平,前沿档位在 500K 到 1M tokens 之间。Inception 不比窗口大小,比的是单次调用多久返回。
速度优势出现在哪里
一次搜索请求通常会展开成几十次模型调用:规划检索、改写查询、重排、结构化事实、总结、再校验答案。Inception 的主张是,扩散模型能把这一整套压进一次用户交互里。
官方在发布时给出了两个生产案例。做 AI 电话智能体的 OpenCall 报告模型响应延迟中位数接近 170 毫秒。Augment Code 称把上下文压缩迁移到 Mercury 后延迟下降 82%,从约 150 秒降到 27 秒,同时成本降低 90%。
这些是厂商转述的客户数字,当作方向性参考。它们支撑的架构结论比具体数值更有用:真正省钱省时间的是你调用最频繁的那些环节,而不是最终写下答案的那一次。
定价
Inception 发布帖给出了以下费率。注意标价与首发促销之间的差距。
| 项目 | 标价 | 首发促销 |
|---|---|---|
| 输入 | $0.20 / 百万 token | $0.04 / 百万 token |
| 输出 | $0.75 / 百万 token | $0.15 / 百万 token |
Artificial Analysis(2026-09-24 核对)列出的价格是输入 $0.25、输出 $0.75,缓存折扣 90%,实测输出速度 770.4 tokens/秒。Inception 自称 1,107 tokens/秒,第三方实测 770,这个差距正好提醒你要用自己的流量做基准测试。
第三方评分说了什么
Artificial Analysis 把 Mercury 2.5 的速度排到 175 个模型中的第 2、成本排第 21,但智能指数排第 91、分数仅 12,并称之为低于平均水平(中位数 13)。它的摘要很直白:智能低于平均、在该价位算便宜、明显很快、相当简洁。
这才是这笔交易的真实形状。Mercury 2.5 不是前沿推理模型,流水线里需要前沿判断力的部分应该继续留在前沿模型上。Mercury 买到的是那些围绕昂贵调用、数量庞大且逻辑简单的周边调用的吞吐与成本。
快速开始
- 先挑出流水线里重复次数最多的调用:路由、上下文压缩、查询改写、工具检索摘要、重排。
- 把这些路由到 Mercury 2.5,困难推理仍留在原处。
- 对比改造前后的端到端延迟和单任务成本,因为收益来自调用频次,而不是单次质量。
- 简单调用把推理强度调低。可调推理强度正是「便宜」与「粗糙」之间的分界线。
局限
- 智能指数低于平均。 它是路由与吞吐模型,不是前沿模型的替代品。
- 仅支持文本。 不接受图像、音频或视频输入。
- 上下文 260K。 需要 1M 级别的长上下文任务得换模型。
- 速度与案例均为厂商自述。 1,107 tokens/秒 是 Inception 的说法,Artificial Analysis 实测 770。
- 促销价。 首发折扣不会永远持续,单位经济模型要按标价算。
常见问题
什么是扩散语言模型?
它不逐 token 顺序输出,而是并行产生并精修多个 token。这正是速度与 token 效率优势的来源。
Mercury 2.5 能替代前沿模型吗?
不能。第三方评分显示其智能水平明显低于前沿档。它的位置是围绕前沿模型的高频周边调用。
在哪里可以使用?
Inception 自家的 API,以及 Baseten 和 OpenRouter。Inception 还提供 1 亿免费 token 供试用。
替代方案
- Cohere Command A+:企业级替代方案,支持 48 种语言且开放权重。
- GPT-6 Luna:当你需要智能而不是速度时的低成本准前沿选项。
- Qwen3.8-Flash-Next:上下文窗口大得多的高吞吐替代方案。
总结
Mercury 2.5 说明了一件事:技术栈里最快的那个模型,往往是你每个请求要调四十次的那个。以 770 到 1,107 tokens/秒 的速度,它是当前市面上最快的推理模型。第三方评分同样清楚地说明它不是前沿模型,所以价值完全取决于你把它放在哪里。重复性调用交给它,判断性调用留在别处,并且要衡量整条流水线而不是单次调用。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。