Ember-1 logo

Ember-1

打开

Fireworks Research 把 Kimi K3 改造成「想得更少」的版本:基准分数基本不变而 token 少约 40%,1M 上下文,每百万 token 输入 3 美元、输出 15 美元。

分享:
查看替代方案

Ember-1

Ember-1 是 Fireworks Research 的第一个专用模型,2026-09-23 发布,跑在 Fireworks 自家 serverless API 上。它基于 Kimi K3 改造,只主张一件事:保持 Kimi K3 的质量,token 少大约 40%。官方的说法是「一半的 token,一样的答案」,并把它定为「专用智能(specialized intelligence)」系列的第一款,而不是又一个前沿模型。

模型库页面把创建日期标为 2026-09-22,发布文日期是 2026-09-23。

为什么省 token 本身就是产品

推理模型大部分生成 token 都花在思考上。Fireworks 测到 Kimi K3 有时超过 90% 的输出 token 用在内部推理,而在多轮 Agent 任务里代价会放大:每一轮都会把之前的推理重新送回上下文,早轮的思考轨迹在后续每次调用里被反复读取、反复计费。

把 reasoning effort 调低不是解法,因为低档掉的质量太多。于是他们选择训练模型「更高效地思考」:在 Fireworks Serverless Training 上跑了 50 多次训练实验、200 多次评估,并称在七个基准和两个客户的线上流量上,Kimi K3 的推理长度可以压掉 35% 到 50% 而不损失准确率。

模型规格

规格 Ember-1
基础模型 Kimi K3
提供方 Fireworks AI
架构 混合专家(MoE),2.78T 参数
上下文窗口 1,040K token
最大输出 943,718 token(OpenRouter 标注)
输入 文本与图像
推理档位 low / high / max,默认 max
工具调用 支持 function calling 与结构化输出
微调 模型库标注不支持;官方称正在为 Ember-1 上线训练支持
定价 输入 $3.00 / 缓存输入 $0.30 / 输出 $15.00(每百万 token)
发布日期 2026-09-23,Research Preview

基准成绩

Fireworks 拿 Ember-1 与基础模型的三个 reasoning effort 档位对比。成本列是相对 K3 max 的差异。

基准 N K3 low K3 high K3 max Ember-1 成本对比 K3 max
Terminal Bench 2.1 89 76.4% 77.6% 80.9% 82.0% -51.9%
SWE-bench Verified 500 80.4% 86.0% 93.2% 92.2% -15.5%
SWE-Interact 75 6.7% 13.3% 21.3% 20.0% -32.5%
DeepSWE 1.1 113 55.8% 62.8% 66.4% 75.2% -23.7%
τ-2 Bench Airline 50 64% 64% 64% 66% -5.9%

诚实地读这张表:Ember-1 在 Terminal Bench 2.1、DeepSWE 1.1 和航空工具调用集上超过 K3 max,在 SWE-bench Verified 与 SWE-Interact 上略低,而全面压过 K3 的 low 档。真正的优势在成本列,不是能力上限。

Fireworks 还称 Ember-1 在 Doximity 的 Bedside Bench(由医生验证、覆盖 500 个临床案例的基准)上刷新了 cost-per-task 的帕累托前沿,参与比较的包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。

生产环境证据

两个客户在生产编码负载上跑了 A/B 测试,都看到每任务 token 减少约 35% 而质量相当;其中一家已经把 Ember-1 放进生产,并计划完全替换基础模型。内部方面,Fireworks 先让自家工程师无感切换,测得每任务输出 token 从 49.3K 降到 29.9K,推理 token 减少 71.3%。

这些都是厂商数据,尚无独立复现。但方向性结论值得记住:省下来的,是那些从未改变答案的推理。

定价

Ember-1 的价格是每百万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00,与 Kimi K3 的公开 API 价格一致。也就是说 Fireworks 并没有给更便宜的价格表,而是在同一张价格表上卖更少的 token,所以省的钱只出现在推理 token 占大头的负载上。

快速开始

  1. 通过 serverless API、Fireworks Python 客户端、REST 或 OpenAI 兼容客户端调用 accounts/fireworks/models/ember-1
  2. 除非受延迟约束,reasoning effort 保持默认的 max;这个模型的意义就在于 max 档变得可负担。
  3. 在多轮 Agent 循环里按「每任务 token」而不是「每次调用 token」来衡量,差距是在这里累积的。
  4. 需要定制版本的话,Fireworks 称已为企业提供 Ember-1 的训练支持。

限制

  • 这是一个 research preview。 Fireworks 说研究版本提供两周 serverless 访问权,之后按社区需求决定是否长期保留。别在没有备选的情况下做长期依赖。
  • 只有厂商基准。 帕累托前沿和 A/B 数据都来自 Fireworks,Bedside Bench 结果用的是他们自己发布的 Specialized Intelligence Index。
  • 它继承基础模型的天花板。 Ember-1 是 Kimi K3 之上的效率层,K3 不具备的能力它也没有。
  • 目前不能微调。 模型库标注不支持微调,而训练支持才刚宣布。

常见问题

Ember-1 是新的前沿模型吗?

不是。它是基于 Kimi K3 的专用模型,用更短的推理轨迹换同样的答案,可以理解为新的成本档位,而不是新的能力档位。

哪些负载收益最大?

Agent 编码和多轮工具循环,因为每一轮都会把此前的推理重新塞进上下文。单轮短提示的收益小得多。

在哪里可以用?

Fireworks 的 serverless API 和按需部署,OpenRouter 上也有。基础版 Kimi K3 依然作为可选项并存。

能直接跑生产流量吗?

Fireworks 称已有一个客户在生产上运行。考虑到 preview 状态,建议把基础模型配置成可随时切回的备选。

替代方案

  • Kimi K3:基础模型,保留完整推理轨迹,也有开放权重。
  • GPT-6 Sol:想要更强能力并愿意付钱时的前沿编码选择。
  • Mercury 2.5:更快也更便宜,适合放在前沿模型周边的高频调用。

总结

Ember-1 押的是下一轮模型竞争会围绕「每任务 token」而不是基准分展开。它保住 Kimi K3 的答案,砍掉那些不影响结果的推理,并在一个经医生验证的临床基准上站到了成本前沿。认真对待它的 preview 状态,量一下自己的 token 数,它是目前给 Agent 编码降本最便宜的办法之一。

评论

还没有评论。成为第一个评论的人!