Ternary Bonsai 2 是 Prism ML 把 Qwen3.8-27B 打成三值、给 llama.cpp 用的包。权重在 prism-ml/Ternary-Bonsai-2-27B-gguf,创建于 2026-09-16,Apache 2.0。2026-09-19 Hugging Face 该 GGUF 仓显示 920 likes、405,609 downloads。这些是热度信号,不是站点访问量。r/LocalLLaMA 有 1.6K 赞的发布帖,2026-09-19 还有后续讨论。
语言骨干 27.36B 参数,混合注意力(约 75% 线性)。上下文 262K,继承基座。若要稀疏云端 MoE 而不是磁盘上的稠密 27B,看 Qwen3.8-Flash-Next。
核心功能
- Ternary g128:权值取 {-1, 0, +1},每 128 个一组 FP16 缩放。模型卡写理想 1.72 bits/weight,GGUF PTQ1_0 为 5.95 GB(1.75 bits),PQ2_0 为 7.21 GB。
- 第一方分数:模型卡称保住 FP16 智力的 98.2%(14 项 thinking 基准平均 84.78),Apple M5 Max 约 47 tok/s。这是 Prism ML 的数,不是审计。
- 可选视觉:单独的 Q8_0 mmproj(约 0.63 GB),只有图像时才加载。
- 后端:Prism ML 的 llama.cpp fork(CUDA、Metal、CPU)和 MLX 2-bit 配套。
- 采样:thinking
temperature=1.0、top_p=0.95;instructtemperature=0.7、top_p=0.80。默认推理强度xhigh。不支持low。
限制:原版 llama.cpp 加载不了。必须用 Prism ML fork(或 MLX fork)。r/LocalLLaMA 有人报过思考循环和 token 偏高;那是社区报告,不是模型卡声明。
适用场景
- 笔记本和单卡,放不下 Qwen3.8-27B 的 54 GB FP16。
- 本地智能体,模型卡给出的工具调用分数是 74.92。
- 不要选它 如果你要托管 API。用 Qwen3.8-Flash-Next。
定价方案
| 部分 | 价格 | 2026-09-19 第一方页面 |
|---|---|---|
| GGUF / MLX 权重 | $0 | Apache 2.0。GGUF 仓约 920 likes。 |
| 运行时 | $0 | Prism ML 的 llama.cpp 或 MLX fork。Demo 仓约 2659 star。 |
快速开始
- 读 demo README。钉死的二进制以它为准。
- 从 Hugging Face 下 PTQ10(5.95 GB)或 PQ20(7.21 GB)。
- 用 Prism ML 的 llama.cpp 或 MLX 构建来 serve,不要用原版 llama.cpp。
- 只有传图像时再加 mmproj。
常见问题
这是新架构吗?
不是。模型卡写架构相对 Qwen3.8-27B 没改。变的是三值打包和定制核。
能用原版 llama.cpp 吗?
按模型卡不行。打包权重需要匹配的 Hadamard 运行时。
必须要视觉塔吗?
不必。纯文本 serving 不加载 mmproj。
替代方案
- Qwen3.8-27B:全精度稠密基座。
- Qwen3.8-Flash-Next:稀疏开源 MoE,不是 6 GB 笔记本文件。
- MiniMax Code:终端智能体,不是权重包。
使用技巧
- 钉 demo 的二进制。fork 会动。
- 先试 PTQ10,除非核表说你的 GPU 上 PQ20 更快。
- 把 98.2% 和 47 tok/s 当模型卡声明,用自己的机器再测。
总结
Ternary Bonsai 2 是给已经在跑 llama.cpp 或 MLX、并愿意装 Prism ML fork 的人准备的 6 GB 三值 Qwen3.8-27B 包。下 GGUF,跟 demo README,自己跑分。它不能当原版 llama.cpp 的即插即用替换。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。