Bespoke Nimble logo

Bespoke Nimble

開く

Bespoke Labs のオープンウェイト 9B モデルと学習レシピ。Jev 型の判定を、確率付きの単一トークン選択としてローカルで実行できます。

共有:
代替ツールを見る

Bespoke Nimble は、Jev 型の判定モデルの裏側をすべて公開しようという Bespoke Labs の試みです。データ、重み、学習レシピをまとめて出しています。Jev は API 経由でしか呼べないクローズドな System One モデルですが、Nimble はダウンロードして自分のマシンで動かせる 9B モデルです。テキストとフラットなスキーマを渡すと、型付きの判定を返します。各質問について、選んだ答えと、許可された各答えの確率です。推論を先に書かないため高速で、JSON も生成しないため解析の手間がありません。第一者リポジトリ2026-09-18 に作成され、2026-09-21 の GitHub は 1,111 stars80 forks でした。ただし同日時点でリポジトリには ライセンスファイルがありません。重みは bespokelabs/Bespoke-Nimble-9B にあり、商用利用を検討する場合は先にラボと条件を確認してください。

仕組み

最も興味深いのは学習手法で、ラボはこれを contrastive data curation(対比的なデータ整備) と呼びます。確率付きのラベルを集める代わりに、ほぼ同一のサンプルを対で作り、正解が反転するだけの 1 つの事実を変えます。これによりモデルは「どの証拠が判断を変えるべきか」を学ばされます。学習は Qwen3.5-9B に対する LoRA 微調整で、損失は答えのトークンのみに掛けます。学習データは 10 カテゴリからなる完全合成の 2,676 件です。このリリースに強化学習は使われていません。

結果

ラボ自身の 324 件のホールドアウトで、Bespoke-Nimble-9B は参照ラベルと 90.1% 一致しました。未調整の Qwen3.5-9B ベースは 66.4%、Jev 1.13.0 は 93.2% です。これはラボの評価セット上のラボの数字であり、README もこの種のモデルに標準ベンチマークは存在しないと明言しているため、学習領域の外では大きく劣る可能性があります。「レシピが機能する証拠」として読み、汎用ランキングとは考えないでください。

推論の方式

  • 質問ごとに答えトークンは 1 つ:許可された各答えに 1 トークンのコードがあり、スコアラは生成ではなくそのコード上の logits を読みます。
  • 構造的に校正済み:logits は softmax を通るため、確率は与えた答えの間で合計 1 になります。構造化出力は自分のコードで組み立てます。
  • 並列スコアリング:Mac では ParallelScorer が共有コンテキストを 1 度だけ読み、すべてのフィールドを並列で採点します。CUDA 経路はフィールドごとに個別に採点します。
  • Apple Silicon か NVIDIA:量子化なしでは 9B の重みだけで約 18 GB、マージ手順には追加の RAM とディスクが必要です。

使用シナリオ

  • ルーティング:行き先と選択条件を宣言し、選ばれた行き先と確率を受け取ります。
  • ポリシー検査と評価:明確な基準を持つ段階を、型付き判定と各段階の確率に変換します。
  • エージェント評価:はい/いいえの質問で実行を採点し、質問ごとにフル生成のコストを払う必要をなくします。

制約は重要です。Nimble は テキストのみを受け取り、与えられた答えからしか選べず、ネストしたスキーマや入力からの抜き出しは返せません。スキーマはフラットである必要があり、enum フィールドは最大 26 個、1 プロンプトはスキーマを含めて 2,048 トークン上限です。確率は精度の保証ではありません。0.9 は正解率 90% を意味しないため、自分のデータでしきい値を検証し、どの答えも当てはまらない可能性があるなら「該当なし」の選択肢を加えてください。フィールドは独立に採点されるので、整合性の担保はアプリ側のコードの役目です。

料金プラン

プラン 価格 説明
モデルとレシピ $0 公開リポジトリと公開重み。ライセンスファイルは未公開。
推論 自分のハードウェア Apple Silicon か NVIDIA GPU でローカル実行。API キーは不要。

2026-09-21 時点でホスト型 API も有償プランもありません。

はじめに

git clone https://github.com/bespokelabsai/nimble.git nimble
cd nimble
python3.12 -m venv .cache/venvs/nimble
source .cache/venvs/nimble/bin/activate
python -m pip install torch==2.8.0 -r requirements/training.txt

同梱のダウンロードスクリプトが bespokelabs/Bespoke-Nimble-9B を取得し、リリースがアダプタならマージし、解決した revision を記録してスコアリング用プロンプトとモデルの版を一致させます。

よくある質問

これは Jev のクローンですか?

いいえ。README は Jev からの蒸留を行っておらず、評価にのみ使ったと明記しています。公開の狙いは、この種のモデルのデータ整備、学習、配信の方法を示すことです。

答えを説明できますか?

できません。推論を生成せず、自分でテキストを書くこともできません。説明が必要ならチャットモデルと組み合わせ、判断は Nimble に任せます。

API キーは必要ですか?

ローカル推論には不要です。TypeSafe や生成サービスのキーは経路に入りません。

代替案

  • Jev:このレシピが比較対象とするクローズドモデル。重みではなく API として提供されます。
  • Qwen3.8-27B:単発の型付き判定ではなく生成が必要なときの、より大きな汎用 Qwen モデル。
  • Ternary Bonsai 2:安価な分類タスクで比較する価値のある、もう 1 つの小型ローカル実行モデル。

ヒント

  1. 各 enum には必ず「該当なし」を入れてください。モデルは列挙した答えからしか選べず、自信ありげな確率も正規化されたスコアにすぎません。
  2. 1 フィールドに 1 問だけ。フィールドは独立に採点され互いを見ないため、フィールド間の論理はアプリ側コードに置きます。
  3. 推論だけでなくマージ用のメモリも見積もってください。重みは量子化前で約 18 GB、マージにはさらに余裕が必要です。

まとめ

Bespoke Nimble は「重みが付いたレシピ」として読むのが最適です。2 日で作られたオープンな実装が、ラボ自身の評価で 9B モデルをクローズドな System One モデルに近づけました。型付きで確率付きの判定を、毎回 API を叩かずローカルで動かしたいなら、現時点で最も明快な実例です。ただし出荷前にライセンス状況は自分で確認してください。

コメント

まだコメントがありません。最初のコメントを投稿してください!