Ember-1 logo

Ember-1

開く

Fireworks Research が Kimi K3 を「考えすぎない」モデルに作り替えた派生版。ベンチマーク品質はほぼ同じでトークンは約 40% 削減、100 万トークンあたり入力 $3・出力 $15。

共有:
代替ツールを見る

Ember-1

Ember-1 は Fireworks Research の最初の特化モデルで、2026-09-23 に発表され、Fireworks 自身のサーバーレス API から提供されます。Kimi K3 を基に作られ、主張はひとつに絞られています。Kimi K3 の品質を保ったまま、トークンを約 40% 削減する。同社はこれを「半分のトークン、同じ答え」と表現し、フロンティアモデルをもう 1 つ出すのではなく、specialized intelligence(特化型知能)シリーズの第 1 弾として位置づけています。

モデルライブラリ上の作成日は 2026-09-22、発表記事の日付は 2026-09-23 です。

トークン効率そのものが製品である理由

推論モデルは生成トークンの大半を思考に使います。Fireworks の測定では、Kimi K3 は出力の 90% を超えるトークンを内部推論に費やすことがあり、エージェント作業ではそのコストが増幅します。各ターンで以前の推論がコンテキストに再投入されるため、早い段階の思考痕跡がその後の呼び出しごとに読み直され、課金され続けるのです。

推論エフォートを下げるのは解決策になりませんでした。低い設定では品質の犠牲が大きすぎたからです。そこでチームは「より効率的に考える」ようモデルを訓練しました。Fireworks Serverless Training 上で 50 以上の訓練実験と 200 以上の評価を回し、7 つのベンチマークと 2 社の本番トラフィックで、Kimi K3 の推論を 35〜50% 短縮しても精度が落ちないと報告しています。

モデル仕様

仕様 Ember-1
ベースモデル Kimi K3
提供元 Fireworks AI
アーキテクチャ Mixture-of-Experts、2.78T パラメータ
コンテキスト 1,040K トークン
最大出力 943,718 トークン(OpenRouter 表記)
入力 テキストと画像
推論エフォート low / high / max(既定は max)
ツール利用 関数呼び出し、構造化出力
ファインチューニング ライブラリ表記は非対応。訓練サポートを提供開始と発表
料金 入力 $3.00 / キャッシュ入力 $0.30 / 出力 $15.00(100 万トークンあたり)
公開日 2026-09-23、Research Preview

ベンチマーク

Fireworks は Ember-1 をベースモデルの 3 つの推論エフォート設定と比較しています。コスト列は K3 max に対する差分です。

ベンチマーク N K3 low K3 high K3 max Ember-1 コスト比較(K3 max 比)
Terminal Bench 2.1 89 76.4% 77.6% 80.9% 82.0% -51.9%
SWE-bench Verified 500 80.4% 86.0% 93.2% 92.2% -15.5%
SWE-Interact 75 6.7% 13.3% 21.3% 20.0% -32.5%
DeepSWE 1.1 113 55.8% 62.8% 66.4% 75.2% -23.7%
τ-2 Bench Airline 50 64% 64% 64% 66% -5.9%

表は正直に読むべきです。Ember-1 は Terminal Bench 2.1、DeepSWE 1.1、航空会社のツール利用セットで K3 max を上回り、SWE-bench Verified と SWE-Interact ではわずかに下回ります。一方で K3 の low 設定はすべての項目で上回ります。価値があるのはコスト列であり、能力の天井が上がったわけではありません。

さらに Fireworks は、医師が検証した 500 の臨床ケースからなる Doximity の Bedside Bench で、Ember-1 が cost-per-task のパレートフロンティアを更新したと報告しています。比較対象には GPT-5.6 Sol、GPT-6 Astra、Claude Opus 5 が含まれます。

本番環境での検証

2 社の顧客が本番のコーディングワークロードで A/B テストを実施し、いずれもタスクあたりのトークンが約 35% 減り、品質は同等でした。うち 1 社はすでに Ember-1 を本番で稼働させ、ベースモデルの完全な置き換えを計画しています。社内では顧客より先に自社開発者へ無告知で切り替え、タスクあたりの出力トークンが 49.3K から 29.9K に、推論トークンが 71.3% 減ったとしています。

これらはすべてベンダー申告の数値で、独立した再現はまだありません。それでも方向性は有用です。削られたのは、答えを変えなかった推論です。

料金

Ember-1 の価格は入力 100 万トークンあたり $3.00、キャッシュ入力 $0.30、出力 $15.00 で、Kimi K3 の公開 API 価格と同じです。Fireworks は安い価格表を売っているのではなく、同じ価格表でより少ないトークンを売っています。したがって節約は、推論トークンが請求の大半を占めるワークロードでだけ現れます。

はじめかた

  1. accounts/fireworks/models/ember-1 をサーバーレス API、Fireworks の Python クライアント、REST、または OpenAI 互換クライアントから呼び出します。
  2. レイテンシ制約がない限り、推論エフォートは既定の max のままで。このモデルの意味は max が手頃になったことにあります。
  3. マルチターンのエージェントループでは、呼び出しあたりではなくタスクあたりのトークンで測ってください。差はそこで積み上がります。
  4. 専用版が必要なら、Fireworks は Ember-1 の訓練サポートを企業向けに提供するとしています。

制限

  • Research Preview です。 研究リリースには 2 週間のサーバーレスアクセスが付き、その後はコミュニティの需要次第で恒久化される、という位置づけです。長期依存を作るなら代替を用意してください。
  • ベンチマークはベンダー自身のもの。 パレートフロンティアも A/B の結果も Fireworks の発表によるもので、Bedside Bench の結果は同社が公開している Specialized Intelligence Index を用いています。
  • ベースモデルの天井を引き継ぎます。 Ember-1 は Kimi K3 上の効率レイヤーであり、K3 にない能力は現れません。
  • 現時点でファインチューニングは不可。 モデルライブラリは非対応と表記しており、訓練サポートは始まったばかりです。

よくある質問

Ember-1 は新しいフロンティアモデルですか?

いいえ。Kimi K3 を基にした特化モデルで、同じ答えに対してより短い推論を返します。能力の階層ではなく、コストの階層と考えるのが適切です。

どのワークロードで効果が大きいですか?

エージェント型コーディングやマルチターンのツールループです。各ターンで以前の推論がコンテキストに再投入されるためで、単発の短いプロンプトでは効果はごく小さくなります。

どこで使えますか?

Fireworks のサーバーレス API とオンデマンドデプロイ、そして OpenRouter に掲載されています。ベースの Kimi K3 も提供オプションとして並存します。

本番トラフィックに向けられますか?

Fireworks はすでに 1 社が本番で稼働しているとしています。プレビュー状態を踏まえ、ベースモデルをいつでも切り戻せる構成にしておくのが妥当です。

代替案

  • Kimi K3: ベースモデル。完全な推論痕跡とオープンな重みを持ちます。
  • GPT-6 Sol: より高い能力にコストを払う場合のフロンティアなコーディング選択肢。
  • Mercury 2.5: さらに高速で安価。フロンティアモデルの周囲の高頻度呼び出しに向きます。

まとめ

Ember-1 は、次の競争がベンチマークの点数ではなくタスクあたりのトークンで起きるという賭けです。Kimi K3 の答えを保ち、結果に効かなかった推論を削り、医師が検証した臨床ベンチマークのコストフロンティアに並びました。プレビューという位置づけを重く受け止め、自分のトークン数を測るなら、エージェント型コーディングの請求を下げる最も安価な手段のひとつです。

コメント

まだコメントがありません。最初のコメントを投稿してください!