Mercury 2.5 logo

Mercury 2.5

打开

Inception 的扩散语言模型:260K 上下文,并行生成 1,107 tokens/s,首发期输入仅 $0.04/百万 token。

分享:
查看替代方案

Mercury 2.5

Mercury 2.5 是 Inception 的第三代生产模型,也是这家公司目前最强的扩散语言模型(dLLM),发布于 2026-09-08。技术赌注从 Inception 的第一代 Mercury 起就没变过:不是逐 token 顺序生成,而是并行起草并反复精修多个 token。Inception 称这是迄今训练过的最大扩散语言模型,目标场景是「延迟本身就是产品」的负载,比如搜索流水线、语音智能体和编码子智能体。

模型规格

规格 Mercury 2.5
架构 扩散语言模型(dLLM)
上下文窗口 260K tokens
输入 文本
输出 文本
推理 可调推理强度
工具调用 并行工具调用、符合 schema 的 JSON
速度 1,107 tokens/秒
发布时间 2026-09-08

260K 上下文在 2026 年属于中位水平,前沿档位在 500K 到 1M tokens 之间。Inception 不比窗口大小,比的是单次调用多久返回。

速度优势出现在哪里

一次搜索请求通常会展开成几十次模型调用:规划检索、改写查询、重排、结构化事实、总结、再校验答案。Inception 的主张是,扩散模型能把这一整套压进一次用户交互里。

官方在发布时给出了两个生产案例。做 AI 电话智能体的 OpenCall 报告模型响应延迟中位数接近 170 毫秒。Augment Code 称把上下文压缩迁移到 Mercury 后延迟下降 82%,从约 150 秒降到 27 秒,同时成本降低 90%。

这些是厂商转述的客户数字,当作方向性参考。它们支撑的架构结论比具体数值更有用:真正省钱省时间的是你调用最频繁的那些环节,而不是最终写下答案的那一次。

定价

Inception 发布帖给出了以下费率。注意标价与首发促销之间的差距。

项目 标价 首发促销
输入 $0.20 / 百万 token $0.04 / 百万 token
输出 $0.75 / 百万 token $0.15 / 百万 token

Artificial Analysis(2026-09-24 核对)列出的价格是输入 $0.25、输出 $0.75,缓存折扣 90%,实测输出速度 770.4 tokens/秒。Inception 自称 1,107 tokens/秒,第三方实测 770,这个差距正好提醒你要用自己的流量做基准测试。

第三方评分说了什么

Artificial Analysis 把 Mercury 2.5 的速度排到 175 个模型中的第 2、成本排第 21,但智能指数排第 91、分数仅 12,并称之为低于平均水平(中位数 13)。它的摘要很直白:智能低于平均、在该价位算便宜、明显很快、相当简洁。

这才是这笔交易的真实形状。Mercury 2.5 不是前沿推理模型,流水线里需要前沿判断力的部分应该继续留在前沿模型上。Mercury 买到的是那些围绕昂贵调用、数量庞大且逻辑简单的周边调用的吞吐与成本。

快速开始

  1. 先挑出流水线里重复次数最多的调用:路由、上下文压缩、查询改写、工具检索摘要、重排。
  2. 把这些路由到 Mercury 2.5,困难推理仍留在原处。
  3. 对比改造前后的端到端延迟和单任务成本,因为收益来自调用频次,而不是单次质量。
  4. 简单调用把推理强度调低。可调推理强度正是「便宜」与「粗糙」之间的分界线。

局限

  • 智能指数低于平均。 它是路由与吞吐模型,不是前沿模型的替代品。
  • 仅支持文本。 不接受图像、音频或视频输入。
  • 上下文 260K。 需要 1M 级别的长上下文任务得换模型。
  • 速度与案例均为厂商自述。 1,107 tokens/秒 是 Inception 的说法,Artificial Analysis 实测 770。
  • 促销价。 首发折扣不会永远持续,单位经济模型要按标价算。

常见问题

什么是扩散语言模型?

它不逐 token 顺序输出,而是并行产生并精修多个 token。这正是速度与 token 效率优势的来源。

Mercury 2.5 能替代前沿模型吗?

不能。第三方评分显示其智能水平明显低于前沿档。它的位置是围绕前沿模型的高频周边调用。

在哪里可以使用?

Inception 自家的 API,以及 Baseten 和 OpenRouter。Inception 还提供 1 亿免费 token 供试用。

替代方案

  • Cohere Command A+:企业级替代方案,支持 48 种语言且开放权重。
  • GPT-6 Luna:当你需要智能而不是速度时的低成本准前沿选项。
  • Qwen3.8-Flash-Next:上下文窗口大得多的高吞吐替代方案。

总结

Mercury 2.5 说明了一件事:技术栈里最快的那个模型,往往是你每个请求要调四十次的那个。以 770 到 1,107 tokens/秒 的速度,它是当前市面上最快的推理模型。第三方评分同样清楚地说明它不是前沿模型,所以价值完全取决于你把它放在哪里。重复性调用交给它,判断性调用留在别处,并且要衡量整条流水线而不是单次调用。

评论

还没有评论。成为第一个评论的人!