Ternary Bonsai 2 は Prism ML が Qwen3.8-27B を三値に詰め、llama.cpp 向けにしたパックです。重みは prism-ml/Ternary-Bonsai-2-27B-gguf、作成日 2026-09-16、Apache 2.0。2026-09-19 の Hugging Face はその GGUF リポジトリで 920 likes、405,609 downloads。熱量の信号であり、サイトのトラフィックではありません。r/LocalLLaMA には 1.6K upvote の公開スレがあり、2026-09-19 にも続きがありました。
言語バックボーンは 27.36B、ハイブリッド注意(約 75% 線形)。コンテキスト 262K は基モデル由来。疎なクラウド MoE が欲しいならディスク上の密 27B ではなく Qwen3.8-Flash-Next です。
主な機能
- Ternary g128:重みは {-1, 0, +1}、128 個ごとに FP16 スケール。カードは理想 1.72 bits/weight、GGUF PTQ1_0 は 5.95 GB(1.75 bits)、PQ2_0 は 7.21 GB。
- 第一者スコア:カードは FP16 知力の 98.2% を保持(thinking 14 本平均 84.78)、Apple M5 Max で約 47 tok/s と書く。Prism ML の数字であり、監査ではありません。
- 任意の視覚:別梱の Q8_0 mmproj(約 0.63 GB)は画像のときだけ読む。
- バックエンド:Prism ML の llama.cpp fork(CUDA、Metal、CPU)と MLX 2-bit 版。
- サンプリング:thinking は
temperature=1.0、top_p=0.95。instruct はtemperature=0.7、top_p=0.80。既定の推理強度はxhigh。lowは非対応。
制約:素の llama.cpp ではロードできません。Prism ML fork(または MLX fork)が必要です。r/LocalLLaMA では思考ループとトークン過多の報告もあります。コミュニティ報告であり、カードの主張ではありません。
使用シナリオ
- Qwen3.8-27B の 54 GB FP16 を置けない ノート PC と 1 GPU。
- カードの agentic 74.92 を前提にした ローカルエージェント。
- ホスト API が欲しいなら 選ばない。Qwen3.8-Flash-Next を使う。
料金プラン
| 部分 | 価格 | 2026-09-19 の第一者ページ |
|---|---|---|
| GGUF / MLX 重み | $0 | Apache 2.0。GGUF リポジトリ約 920 likes。 |
| ランタイム | $0 | Prism ML の llama.cpp または MLX fork。デモリポジトリ約 2659 stars。 |
はじめに
- demo README を読む。ピン留めバイナリの正本です。
- Hugging Face から PTQ10(5.95 GB)か PQ20(7.21 GB)を取る。
- 素の llama.cpp ではなく Prism ML の llama.cpp か MLX で serve する。
- 画像を渡すときだけ mmproj を足す。
よくある質問
新アーキテクチャですか?
いいえ。カードは Qwen3.8-27B からアーキテクチャは変えていないと書きます。変わるのは三値パックと専用カーネルです。
素の llama.cpp は使えますか?
カードによれば不可。パック済み重みは対応する Hadamard ランタイムが要ります。
視覚タワーは必須ですか?
いいえ。テキスト serving は mmproj を読みません。
代替案
- Qwen3.8-27B:フル精度の密基モデル。
- Qwen3.8-Flash-Next:疎なオープン MoE。6 GB のノート用ファイルではない。
- MiniMax Code:ターミナルエージェントであり、重みパックではない。
ヒント
- デモのバイナリをピン留めする。fork は動く。
- 自分の GPU の表が PQ20 の方が速いと言わない限り PTQ10 から。
- 98.2% と 47 tok/s はカードの主張。自分の箱で測る。
まとめ
Ternary Bonsai 2 は、すでに llama.cpp か MLX を回し、Prism ML の fork を入れる人向けの 6 GB 三値 Qwen3.8-27B パックです。GGUF を取り、デモ README に従い、自分で測る。素の llama.cpp の差し替えではありません。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。