Ember-1
Ember-1 は Fireworks Research の最初の特化モデルで、2026-09-23 に発表され、Fireworks 自身のサーバーレス API から提供されます。Kimi K3 を基に作られ、主張はひとつに絞られています。Kimi K3 の品質を保ったまま、トークンを約 40% 削減する。同社はこれを「半分のトークン、同じ答え」と表現し、フロンティアモデルをもう 1 つ出すのではなく、specialized intelligence(特化型知能)シリーズの第 1 弾として位置づけています。
モデルライブラリ上の作成日は 2026-09-22、発表記事の日付は 2026-09-23 です。
トークン効率そのものが製品である理由
推論モデルは生成トークンの大半を思考に使います。Fireworks の測定では、Kimi K3 は出力の 90% を超えるトークンを内部推論に費やすことがあり、エージェント作業ではそのコストが増幅します。各ターンで以前の推論がコンテキストに再投入されるため、早い段階の思考痕跡がその後の呼び出しごとに読み直され、課金され続けるのです。
推論エフォートを下げるのは解決策になりませんでした。低い設定では品質の犠牲が大きすぎたからです。そこでチームは「より効率的に考える」ようモデルを訓練しました。Fireworks Serverless Training 上で 50 以上の訓練実験と 200 以上の評価を回し、7 つのベンチマークと 2 社の本番トラフィックで、Kimi K3 の推論を 35〜50% 短縮しても精度が落ちないと報告しています。
モデル仕様
| 仕様 | Ember-1 |
|---|---|
| ベースモデル | Kimi K3 |
| 提供元 | Fireworks AI |
| アーキテクチャ | Mixture-of-Experts、2.78T パラメータ |
| コンテキスト | 1,040K トークン |
| 最大出力 | 943,718 トークン(OpenRouter 表記) |
| 入力 | テキストと画像 |
| 推論エフォート | low / high / max(既定は max) |
| ツール利用 | 関数呼び出し、構造化出力 |
| ファインチューニング | ライブラリ表記は非対応。訓練サポートを提供開始と発表 |
| 料金 | 入力 $3.00 / キャッシュ入力 $0.30 / 出力 $15.00(100 万トークンあたり) |
| 公開日 | 2026-09-23、Research Preview |
ベンチマーク
Fireworks は Ember-1 をベースモデルの 3 つの推論エフォート設定と比較しています。コスト列は K3 max に対する差分です。
| ベンチマーク | N | K3 low | K3 high | K3 max | Ember-1 | コスト比較(K3 max 比) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% |
表は正直に読むべきです。Ember-1 は Terminal Bench 2.1、DeepSWE 1.1、航空会社のツール利用セットで K3 max を上回り、SWE-bench Verified と SWE-Interact ではわずかに下回ります。一方で K3 の low 設定はすべての項目で上回ります。価値があるのはコスト列であり、能力の天井が上がったわけではありません。
さらに Fireworks は、医師が検証した 500 の臨床ケースからなる Doximity の Bedside Bench で、Ember-1 が cost-per-task のパレートフロンティアを更新したと報告しています。比較対象には GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 が含まれます。
本番環境での検証
2 社の顧客が本番のコーディングワークロードで A/B テストを実施し、いずれもタスクあたりのトークンが約 35% 減り、品質は同等でした。うち 1 社はすでに Ember-1 を本番で稼働させ、ベースモデルの完全な置き換えを計画しています。社内では顧客より先に自社開発者へ無告知で切り替え、タスクあたりの出力トークンが 49.3K から 29.9K に、推論トークンが 71.3% 減ったとしています。
これらはすべてベンダー申告の数値で、独立した再現はまだありません。それでも方向性は有用です。削られたのは、答えを変えなかった推論です。
料金
Ember-1 の価格は入力 100 万トークンあたり $3.00、キャッシュ入力 $0.30、出力 $15.00 で、Kimi K3 の公開 API 価格と同じです。Fireworks は安い価格表を売っているのではなく、同じ価格表でより少ないトークンを売っています。したがって節約は、推論トークンが請求の大半を占めるワークロードでだけ現れます。
はじめかた
accounts/fireworks/models/ember-1をサーバーレス API、Fireworks の Python クライアント、REST、または OpenAI 互換クライアントから呼び出します。- レイテンシ制約がない限り、推論エフォートは既定の max のままで。このモデルの意味は max が手頃になったことにあります。
- マルチターンのエージェントループでは、呼び出しあたりではなくタスクあたりのトークンで測ってください。差はそこで積み上がります。
- 専用版が必要なら、Fireworks は Ember-1 の訓練サポートを企業向けに提供するとしています。
制限
- Research Preview です。 研究リリースには 2 週間のサーバーレスアクセスが付き、その後はコミュニティの需要次第で恒久化される、という位置づけです。長期依存を作るなら代替を用意してください。
- ベンチマークはベンダー自身のもの。 パレートフロンティアも A/B の結果も Fireworks の発表によるもので、Bedside Bench の結果は同社が公開している Specialized Intelligence Index を用いています。
- ベースモデルの天井を引き継ぎます。 Ember-1 は Kimi K3 上の効率レイヤーであり、K3 にない能力は現れません。
- 現時点でファインチューニングは不可。 モデルライブラリは非対応と表記しており、訓練サポートは始まったばかりです。
よくある質問
Ember-1 は新しいフロンティアモデルですか?
いいえ。Kimi K3 を基にした特化モデルで、同じ答えに対してより短い推論を返します。能力の階層ではなく、コストの階層と考えるのが適切です。
どのワークロードで効果が大きいですか?
エージェント型コーディングやマルチターンのツールループです。各ターンで以前の推論がコンテキストに再投入されるためで、単発の短いプロンプトでは効果はごく小さくなります。
どこで使えますか?
Fireworks のサーバーレス API とオンデマンドデプロイ、そして OpenRouter に掲載されています。ベースの Kimi K3 も提供オプションとして並存します。
本番トラフィックに向けられますか?
Fireworks はすでに 1 社が本番で稼働しているとしています。プレビュー状態を踏まえ、ベースモデルをいつでも切り戻せる構成にしておくのが妥当です。
代替案
- Kimi K3: ベースモデル。完全な推論痕跡とオープンな重みを持ちます。
- GPT-6 Sol: より高い能力にコストを払う場合のフロンティアなコーディング選択肢。
- Mercury 2.5: さらに高速で安価。フロンティアモデルの周囲の高頻度呼び出しに向きます。
まとめ
Ember-1 は、次の競争がベンチマークの点数ではなくタスクあたりのトークンで起きるという賭けです。Kimi K3 の答えを保ち、結果に効かなかった推論を削り、医師が検証した臨床ベンチマークのコストフロンティアに並びました。プレビューという位置づけを重く受け止め、自分のトークン数を測るなら、エージェント型コーディングの請求を下げる最も安価な手段のひとつです。
コメント
まだコメントがありません。最初のコメントを投稿してください!