Bespoke Nimble 是 Bespoke Labs 的一次「把 Jev 式判定模型背后的东西全公开」的尝试:数据、权重和训练配方一起给。Jev 是只能通过 API 调用的闭源 System One 模型,而 Nimble 是一个你可以下载并在本机运行的 9B 模型。给它一段文本和一个扁平 schema,它返回类型化判定:每个问题给出它选中的答案,以及每个允许答案的概率。它不先写推理,所以很快;它不生成 JSON,所以没有解析负担。第一方仓库 创建于 2026-09-18,2026-09-21 GitHub 显示 1,111 star、80 fork。需要提醒的是,截至该日期仓库没有发布任何许可证文件;权重位于 bespokelabs/Bespoke-Nimble-9B,计划商用的团队应先与该实验室确认授权条款。
工作原理
最有意思的是训练方法,实验室称之为 对比式数据整理(contrastive data curation)。他们不去收集带概率标注的样本,而是构造一对几乎完全相同的样本,只改动一个足以让正确答案翻转的事实。模型因此被迫学会:到底哪一条证据才应该改变决策。训练是在 Qwen3.5-9B 上做 LoRA 微调,只对答案 token 计算损失,训练集是 2,676 条来自 10 个类别、完全合成的数据。这一版没有使用强化学习。
效果
在实验室自己的 324 条留出样本上,Bespoke-Nimble-9B 与参考标签的一致率为 90.1%,未微调的 Qwen3.5-9B 基座为 66.4%,Jev 1.13.0 为 93.2%。这些是实验室在其自有评测集上的数字,README 也直说了这类模型没有标准基准,因此在训练领域之外可能明显更差。可以把它当作「配方有效」的证据,而不是通用排名。
推理方式
- 每个问题只产出一个答案 token:每个允许答案都有一个单 token 编码,打分器读取模型在这些编码上的 logits,而不是生成文本。
- 概率天然归一:logits 经过 softmax,概率在你给出的答案之间加和为 1,结构化输出由你的代码拼装。
- 并行打分:在 Mac 上
ParallelScorer只读一次共享上下文,然后并行给所有字段打分;CUDA 路径则逐个字段分别打分。 - Apple Silicon 或 NVIDIA:不量化时,9B 权重本身约占 18 GB,合并步骤还需要额外的内存与磁盘。
适用场景
- 路由:声明目标选项与选择条件,拿回被选中的目标和对应概率。
- 策略校验与评级:把有明确标准的等级变成类型化判定,外加每个等级的概率。
- 智能体评测:用是非题给一次运行打分,而不必为每个问题付一次完整生成的费用。
限制需要认真对待。Nimble 只接受文本,只能在你给的答案里选,不能返回嵌套 schema,也不能从输入里截取一段文本。schema 必须是扁平的,一个 enum 字段最多 26 个选项,单次 prompt 上限 2,048 token(含 schema)。概率不是准确率保证:0.9 不代表 90% 正确,所以要在自己的数据上测阈值,并在任何答案都可能不合适时加一个「无匹配」选项。由于各字段独立打分,字段之间的一致性要由你的代码来保证。
定价方案
| 方案 | 价格 | 说明 |
|---|---|---|
| 模型与配方 | $0 | 公开仓库与公开权重;未发布许可证文件。 |
| 推理 | 自己的硬件 | 在 Apple Silicon 或 NVIDIA GPU 上本地运行,无需 API key。 |
截至 2026-09-21,没有托管 API,也没有付费档位。
快速开始
git clone https://github.com/bespokelabsai/nimble.git nimble
cd nimble
python3.12 -m venv .cache/venvs/nimble
source .cache/venvs/nimble/bin/activate
python -m pip install torch==2.8.0 -r requirements/training.txt
仓库自带的下载脚本会拉取 bespokelabs/Bespoke-Nimble-9B,在发布物是适配器时完成合并,并记录解析到的 revision,保证打分 prompt 与模型版本一致。
常见问题
它是 Jev 的克隆吗?
不是。README 明确说明没有从 Jev 蒸馏,只用 Jev 做了评测。开源的意义在于展示这类模型该怎么整理数据、怎么训练、怎么部署。
它能解释自己的答案吗?
不能。它不生成推理,也不能自己写文本。需要解释时,把它和聊天模型搭配,判定交给 Nimble。
需要 API key 吗?
本地推理不需要。整个链路里没有 TypeSafe 或任何生成服务的 key。
替代方案
- Jev:这个配方用来对标的闭源模型,以 API 而非权重形式提供。
- Qwen3.8-27B:当你需要生成而非单次类型化判定时,更大的通用 Qwen 模型。
- Ternary Bonsai 2:另一款小体量、可本地运行、适合在廉价分类任务上对比的模型。
使用技巧
- 每个 enum 里都加上「无匹配」选项。模型只能在你列出的答案中选择,看起来很自信的概率也只是一个归一化分数。
- 一个字段只放一个问题。字段之间独立打分、互相看不见,跨字段逻辑应该写在应用代码里。
- 为合并步骤预留内存,而不只是推理内存。权重在量化前约 18 GB,合并时还需要额外的余量。
总结
把 Bespoke Nimble 理解成「附带权重的一套配方」最合适:两天做出来的开源实现,在实验室自己的评测上把 9B 模型推到了接近闭源 System One 的水平。如果你想要在本机跑类型化、带概率的判定,而不是每次走 API,它目前是最清晰的完整范例,前提是上线前自行确认授权情况。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。