Ternary Bonsai 2 logo

Ternary Bonsai 2

開く

Ternary Bonsai 2 は 27B の Qwen3.8 三値 GGUF。モデルカードは 5.95 GB で FP16 スコアの 98.2% を保つと書く。

共有:
代替ツールを見る

Ternary Bonsai 2 は Prism ML が Qwen3.8-27B を三値に詰め、llama.cpp 向けにしたパックです。重みは prism-ml/Ternary-Bonsai-2-27B-gguf、作成日 2026-09-16、Apache 2.0。2026-09-19 の Hugging Face はその GGUF リポジトリで 920 likes405,609 downloads。熱量の信号であり、サイトのトラフィックではありません。r/LocalLLaMA には 1.6K upvote の公開スレがあり、2026-09-19 にも続きがありました。

言語バックボーンは 27.36B、ハイブリッド注意(約 75% 線形)。コンテキスト 262K は基モデル由来。疎なクラウド MoE が欲しいならディスク上の密 27B ではなく Qwen3.8-Flash-Next です。

主な機能

  • Ternary g128:重みは {-1, 0, +1}、128 個ごとに FP16 スケール。カードは理想 1.72 bits/weight、GGUF PTQ1_05.95 GB(1.75 bits)、PQ2_07.21 GB
  • 第一者スコア:カードは FP16 知力の 98.2% を保持(thinking 14 本平均 84.78)、Apple M5 Max で約 47 tok/s と書く。Prism ML の数字であり、監査ではありません。
  • 任意の視覚:別梱の Q8_0 mmproj(約 0.63 GB)は画像のときだけ読む。
  • バックエンド:Prism ML の llama.cpp fork(CUDA、Metal、CPU)と MLX 2-bit 版
  • サンプリング:thinking は temperature=1.0top_p=0.95。instruct は temperature=0.7top_p=0.80。既定の推理強度は xhighlow は非対応。

制約:素の llama.cpp ではロードできません。Prism ML fork(または MLX fork)が必要です。r/LocalLLaMA では思考ループとトークン過多の報告もあります。コミュニティ報告であり、カードの主張ではありません。

使用シナリオ

  • Qwen3.8-27B の 54 GB FP16 を置けない ノート PC と 1 GPU
  • カードの agentic 74.92 を前提にした ローカルエージェント
  • ホスト API が欲しいなら 選ばないQwen3.8-Flash-Next を使う。

料金プラン

部分 価格 2026-09-19 の第一者ページ
GGUF / MLX 重み $0 Apache 2.0。GGUF リポジトリ約 920 likes。
ランタイム $0 Prism ML の llama.cpp または MLX fork。デモリポジトリ約 2659 stars。

はじめに

  1. demo README を読む。ピン留めバイナリの正本です。
  2. Hugging Face から PTQ10(5.95 GB)か PQ20(7.21 GB)を取る。
  3. 素の llama.cpp ではなく Prism ML の llama.cpp か MLX で serve する。
  4. 画像を渡すときだけ mmproj を足す。

第一者の起点は モデルカード白書 PDF です。

よくある質問

新アーキテクチャですか?

いいえ。カードは Qwen3.8-27B からアーキテクチャは変えていないと書きます。変わるのは三値パックと専用カーネルです。

素の llama.cpp は使えますか?

カードによれば不可。パック済み重みは対応する Hadamard ランタイムが要ります。

視覚タワーは必須ですか?

いいえ。テキスト serving は mmproj を読みません。

代替案

  • Qwen3.8-27B:フル精度の密基モデル。
  • Qwen3.8-Flash-Next:疎なオープン MoE。6 GB のノート用ファイルではない。
  • MiniMax Code:ターミナルエージェントであり、重みパックではない。

ヒント

  1. デモのバイナリをピン留めする。fork は動く。
  2. 自分の GPU の表が PQ20 の方が速いと言わない限り PTQ10 から。
  3. 98.2% と 47 tok/s はカードの主張。自分の箱で測る。

まとめ

Ternary Bonsai 2 は、すでに llama.cpp か MLX を回し、Prism ML の fork を入れる人向けの 6 GB 三値 Qwen3.8-27B パックです。GGUF を取り、デモ README に従い、自分で測る。素の llama.cpp の差し替えではありません。

コメント

まだコメントがありません。最初のコメントを投稿してください!