Ember-1
Ember-1 是 Fireworks Research 的第一个专用模型,2026-09-23 发布,跑在 Fireworks 自家 serverless API 上。它基于 Kimi K3 改造,只主张一件事:保持 Kimi K3 的质量,token 少大约 40%。官方的说法是「一半的 token,一样的答案」,并把它定为「专用智能(specialized intelligence)」系列的第一款,而不是又一个前沿模型。
模型库页面把创建日期标为 2026-09-22,发布文日期是 2026-09-23。
为什么省 token 本身就是产品
推理模型大部分生成 token 都花在思考上。Fireworks 测到 Kimi K3 有时超过 90% 的输出 token 用在内部推理,而在多轮 Agent 任务里代价会放大:每一轮都会把之前的推理重新送回上下文,早轮的思考轨迹在后续每次调用里被反复读取、反复计费。
把 reasoning effort 调低不是解法,因为低档掉的质量太多。于是他们选择训练模型「更高效地思考」:在 Fireworks Serverless Training 上跑了 50 多次训练实验、200 多次评估,并称在七个基准和两个客户的线上流量上,Kimi K3 的推理长度可以压掉 35% 到 50% 而不损失准确率。
模型规格
| 规格 | Ember-1 |
|---|---|
| 基础模型 | Kimi K3 |
| 提供方 | Fireworks AI |
| 架构 | 混合专家(MoE),2.78T 参数 |
| 上下文窗口 | 1,040K token |
| 最大输出 | 943,718 token(OpenRouter 标注) |
| 输入 | 文本与图像 |
| 推理档位 | low / high / max,默认 max |
| 工具调用 | 支持 function calling 与结构化输出 |
| 微调 | 模型库标注不支持;官方称正在为 Ember-1 上线训练支持 |
| 定价 | 输入 $3.00 / 缓存输入 $0.30 / 输出 $15.00(每百万 token) |
| 发布日期 | 2026-09-23,Research Preview |
基准成绩
Fireworks 拿 Ember-1 与基础模型的三个 reasoning effort 档位对比。成本列是相对 K3 max 的差异。
| 基准 | N | K3 low | K3 high | K3 max | Ember-1 | 成本对比 K3 max |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% |
诚实地读这张表:Ember-1 在 Terminal Bench 2.1、DeepSWE 1.1 和航空工具调用集上超过 K3 max,在 SWE-bench Verified 与 SWE-Interact 上略低,而全面压过 K3 的 low 档。真正的优势在成本列,不是能力上限。
Fireworks 还称 Ember-1 在 Doximity 的 Bedside Bench(由医生验证、覆盖 500 个临床案例的基准)上刷新了 cost-per-task 的帕累托前沿,参与比较的包括 GPT-5.6 Sol、GPT-6 Astra 和 Claude Opus 5。
生产环境证据
两个客户在生产编码负载上跑了 A/B 测试,都看到每任务 token 减少约 35% 而质量相当;其中一家已经把 Ember-1 放进生产,并计划完全替换基础模型。内部方面,Fireworks 先让自家工程师无感切换,测得每任务输出 token 从 49.3K 降到 29.9K,推理 token 减少 71.3%。
这些都是厂商数据,尚无独立复现。但方向性结论值得记住:省下来的,是那些从未改变答案的推理。
定价
Ember-1 的价格是每百万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00,与 Kimi K3 的公开 API 价格一致。也就是说 Fireworks 并没有给更便宜的价格表,而是在同一张价格表上卖更少的 token,所以省的钱只出现在推理 token 占大头的负载上。
快速开始
- 通过 serverless API、Fireworks Python 客户端、REST 或 OpenAI 兼容客户端调用
accounts/fireworks/models/ember-1。 - 除非受延迟约束,reasoning effort 保持默认的 max;这个模型的意义就在于 max 档变得可负担。
- 在多轮 Agent 循环里按「每任务 token」而不是「每次调用 token」来衡量,差距是在这里累积的。
- 需要定制版本的话,Fireworks 称已为企业提供 Ember-1 的训练支持。
限制
- 这是一个 research preview。 Fireworks 说研究版本提供两周 serverless 访问权,之后按社区需求决定是否长期保留。别在没有备选的情况下做长期依赖。
- 只有厂商基准。 帕累托前沿和 A/B 数据都来自 Fireworks,Bedside Bench 结果用的是他们自己发布的 Specialized Intelligence Index。
- 它继承基础模型的天花板。 Ember-1 是 Kimi K3 之上的效率层,K3 不具备的能力它也没有。
- 目前不能微调。 模型库标注不支持微调,而训练支持才刚宣布。
常见问题
Ember-1 是新的前沿模型吗?
不是。它是基于 Kimi K3 的专用模型,用更短的推理轨迹换同样的答案,可以理解为新的成本档位,而不是新的能力档位。
哪些负载收益最大?
Agent 编码和多轮工具循环,因为每一轮都会把此前的推理重新塞进上下文。单轮短提示的收益小得多。
在哪里可以用?
Fireworks 的 serverless API 和按需部署,OpenRouter 上也有。基础版 Kimi K3 依然作为可选项并存。
能直接跑生产流量吗?
Fireworks 称已有一个客户在生产上运行。考虑到 preview 状态,建议把基础模型配置成可随时切回的备选。
替代方案
- Kimi K3:基础模型,保留完整推理轨迹,也有开放权重。
- GPT-6 Sol:想要更强能力并愿意付钱时的前沿编码选择。
- Mercury 2.5:更快也更便宜,适合放在前沿模型周边的高频调用。
总结
Ember-1 押的是下一轮模型竞争会围绕「每任务 token」而不是基准分展开。它保住 Kimi K3 的答案,砍掉那些不影响结果的推理,并在一个经医生验证的临床基准上站到了成本前沿。认真对待它的 preview 状态,量一下自己的 token 数,它是目前给 Agent 编码降本最便宜的办法之一。
评论
还没有评论。成为第一个评论的人!