Ternary Bonsai 2 logo

Ternary Bonsai 2

打开

Ternary Bonsai 2 是 27B 的 Qwen3.8 三值 GGUF,模型卡称在 5.95 GB 包里保住 FP16 分数的 98.2%。

分享:
查看替代方案

Ternary Bonsai 2 是 Prism ML 把 Qwen3.8-27B 打成三值、给 llama.cpp 用的包。权重在 prism-ml/Ternary-Bonsai-2-27B-gguf,创建于 2026-09-16,Apache 2.0。2026-09-19 Hugging Face 该 GGUF 仓显示 920 likes405,609 downloads。这些是热度信号,不是站点访问量。r/LocalLLaMA 有 1.6K 赞的发布帖,2026-09-19 还有后续讨论。

语言骨干 27.36B 参数,混合注意力(约 75% 线性)。上下文 262K,继承基座。若要稀疏云端 MoE 而不是磁盘上的稠密 27B,看 Qwen3.8-Flash-Next

核心功能

  • Ternary g128:权值取 {-1, 0, +1},每 128 个一组 FP16 缩放。模型卡写理想 1.72 bits/weight,GGUF PTQ1_05.95 GB(1.75 bits),PQ2_07.21 GB
  • 第一方分数:模型卡称保住 FP16 智力的 98.2%(14 项 thinking 基准平均 84.78),Apple M5 Max 约 47 tok/s。这是 Prism ML 的数,不是审计。
  • 可选视觉:单独的 Q8_0 mmproj(约 0.63 GB),只有图像时才加载。
  • 后端:Prism ML 的 llama.cpp fork(CUDA、Metal、CPU)和 MLX 2-bit 配套
  • 采样:thinking temperature=1.0top_p=0.95;instruct temperature=0.7top_p=0.80。默认推理强度 xhigh。不支持 low

限制:原版 llama.cpp 加载不了。必须用 Prism ML fork(或 MLX fork)。r/LocalLLaMA 有人报过思考循环和 token 偏高;那是社区报告,不是模型卡声明。

适用场景

  • 笔记本和单卡,放不下 Qwen3.8-27B 的 54 GB FP16。
  • 本地智能体,模型卡给出的工具调用分数是 74.92。
  • 不要选它 如果你要托管 API。用 Qwen3.8-Flash-Next

定价方案

部分 价格 2026-09-19 第一方页面
GGUF / MLX 权重 $0 Apache 2.0。GGUF 仓约 920 likes。
运行时 $0 Prism ML 的 llama.cpp 或 MLX fork。Demo 仓约 2659 star。

快速开始

  1. demo README。钉死的二进制以它为准。
  2. 从 Hugging Face 下 PTQ10(5.95 GB)或 PQ20(7.21 GB)。
  3. 用 Prism ML 的 llama.cpp 或 MLX 构建来 serve,不要用原版 llama.cpp。
  4. 只有传图像时再加 mmproj。

第一方入口:模型卡白皮书 PDF

常见问题

这是新架构吗?

不是。模型卡写架构相对 Qwen3.8-27B 没改。变的是三值打包和定制核。

能用原版 llama.cpp 吗?

按模型卡不行。打包权重需要匹配的 Hadamard 运行时。

必须要视觉塔吗?

不必。纯文本 serving 不加载 mmproj。

替代方案

使用技巧

  1. 钉 demo 的二进制。fork 会动。
  2. 先试 PTQ10,除非核表说你的 GPU 上 PQ20 更快。
  3. 把 98.2% 和 47 tok/s 当模型卡声明,用自己的机器再测。

总结

Ternary Bonsai 2 是给已经在跑 llama.cpp 或 MLX、并愿意装 Prism ML fork 的人准备的 6 GB 三值 Qwen3.8-27B 包。下 GGUF,跟 demo README,自己跑分。它不能当原版 llama.cpp 的即插即用替换。

评论

还没有评论。成为第一个评论的人!