Bespoke Nimble logo

Bespoke Nimble

打开

Bespoke Labs 开源的 9B 权重模型与完整训练配方,把 Jev 式的判定变成带概率的单 token 选择,可在本机运行。

分享:
查看替代方案

Bespoke Nimble 是 Bespoke Labs 的一次「把 Jev 式判定模型背后的东西全公开」的尝试:数据、权重和训练配方一起给。Jev 是只能通过 API 调用的闭源 System One 模型,而 Nimble 是一个你可以下载并在本机运行的 9B 模型。给它一段文本和一个扁平 schema,它返回类型化判定:每个问题给出它选中的答案,以及每个允许答案的概率。它不先写推理,所以很快;它不生成 JSON,所以没有解析负担。第一方仓库 创建于 2026-09-18,2026-09-21 GitHub 显示 1,111 star80 fork。需要提醒的是,截至该日期仓库没有发布任何许可证文件;权重位于 bespokelabs/Bespoke-Nimble-9B,计划商用的团队应先与该实验室确认授权条款。

工作原理

最有意思的是训练方法,实验室称之为 对比式数据整理(contrastive data curation)。他们不去收集带概率标注的样本,而是构造一对几乎完全相同的样本,只改动一个足以让正确答案翻转的事实。模型因此被迫学会:到底哪一条证据才应该改变决策。训练是在 Qwen3.5-9B 上做 LoRA 微调,只对答案 token 计算损失,训练集是 2,676 条来自 10 个类别、完全合成的数据。这一版没有使用强化学习。

效果

在实验室自己的 324 条留出样本上,Bespoke-Nimble-9B 与参考标签的一致率为 90.1%,未微调的 Qwen3.5-9B 基座为 66.4%,Jev 1.13.0 为 93.2%。这些是实验室在其自有评测集上的数字,README 也直说了这类模型没有标准基准,因此在训练领域之外可能明显更差。可以把它当作「配方有效」的证据,而不是通用排名。

推理方式

  • 每个问题只产出一个答案 token:每个允许答案都有一个单 token 编码,打分器读取模型在这些编码上的 logits,而不是生成文本。
  • 概率天然归一:logits 经过 softmax,概率在你给出的答案之间加和为 1,结构化输出由你的代码拼装。
  • 并行打分:在 Mac 上 ParallelScorer 只读一次共享上下文,然后并行给所有字段打分;CUDA 路径则逐个字段分别打分。
  • Apple Silicon 或 NVIDIA:不量化时,9B 权重本身约占 18 GB,合并步骤还需要额外的内存与磁盘。

适用场景

  • 路由:声明目标选项与选择条件,拿回被选中的目标和对应概率。
  • 策略校验与评级:把有明确标准的等级变成类型化判定,外加每个等级的概率。
  • 智能体评测:用是非题给一次运行打分,而不必为每个问题付一次完整生成的费用。

限制需要认真对待。Nimble 只接受文本,只能在你给的答案里选,不能返回嵌套 schema,也不能从输入里截取一段文本。schema 必须是扁平的,一个 enum 字段最多 26 个选项,单次 prompt 上限 2,048 token(含 schema)。概率不是准确率保证:0.9 不代表 90% 正确,所以要在自己的数据上测阈值,并在任何答案都可能不合适时加一个「无匹配」选项。由于各字段独立打分,字段之间的一致性要由你的代码来保证。

定价方案

方案 价格 说明
模型与配方 $0 公开仓库与公开权重;未发布许可证文件。
推理 自己的硬件 在 Apple Silicon 或 NVIDIA GPU 上本地运行,无需 API key。

截至 2026-09-21,没有托管 API,也没有付费档位。

快速开始

git clone https://github.com/bespokelabsai/nimble.git nimble
cd nimble
python3.12 -m venv .cache/venvs/nimble
source .cache/venvs/nimble/bin/activate
python -m pip install torch==2.8.0 -r requirements/training.txt

仓库自带的下载脚本会拉取 bespokelabs/Bespoke-Nimble-9B,在发布物是适配器时完成合并,并记录解析到的 revision,保证打分 prompt 与模型版本一致。

常见问题

它是 Jev 的克隆吗?

不是。README 明确说明没有从 Jev 蒸馏,只用 Jev 做了评测。开源的意义在于展示这类模型该怎么整理数据、怎么训练、怎么部署。

它能解释自己的答案吗?

不能。它不生成推理,也不能自己写文本。需要解释时,把它和聊天模型搭配,判定交给 Nimble。

需要 API key 吗?

本地推理不需要。整个链路里没有 TypeSafe 或任何生成服务的 key。

替代方案

  • Jev:这个配方用来对标的闭源模型,以 API 而非权重形式提供。
  • Qwen3.8-27B:当你需要生成而非单次类型化判定时,更大的通用 Qwen 模型。
  • Ternary Bonsai 2:另一款小体量、可本地运行、适合在廉价分类任务上对比的模型。

使用技巧

  1. 每个 enum 里都加上「无匹配」选项。模型只能在你列出的答案中选择,看起来很自信的概率也只是一个归一化分数。
  2. 一个字段只放一个问题。字段之间独立打分、互相看不见,跨字段逻辑应该写在应用代码里。
  3. 为合并步骤预留内存,而不只是推理内存。权重在量化前约 18 GB,合并时还需要额外的余量。

总结

把 Bespoke Nimble 理解成「附带权重的一套配方」最合适:两天做出来的开源实现,在实验室自己的评测上把 9B 模型推到了接近闭源 System One 的水平。如果你想要在本机跑类型化、带概率的判定,而不是每次走 API,它目前是最清晰的完整范例,前提是上线前自行确认授权情况。

评论

还没有评论。成为第一个评论的人!