Kolibri-1 logo

Kolibri-1

打开

Aleph Alpha 发布的德英双语开放权重推理模型,总参数约 78B、每 token 激活约 3.46B,支持工具调用与长上下文。适合具备服务器资源的自托管评估。

分享:
查看替代方案

Kolibri-1

Kolibri-1 是 Aleph Alpha 于 2026 年 10 月 3 日发布的开放权重文本推理模型,主要面向德语与英语的文档分析和工具辅助任务。它采用混合专家架构,总参数约 780 亿,每个 token 激活约 34.6 亿参数。激活量说明计算规模,却不代表部署时只需加载一个 3B 模型:完整权重仍然要进入部署系统的内存安排。

核心功能与适用场景

模型支持显式推理与工具调用。最大上下文为 1,048,576 token,但官方模型卡建议在服务效率和复杂任务上将输入控制在 262,144 token 以内;原生长上下文训练长度也是 262,144。能接受长输入与能够可靠利用每一段内容是两回事,应通过自己的任务集验证。

适合先做德英双语知识助手:从允许访问的资料中检索少量相关段落,让模型给出带来源的回答,再核对引文。另一个方向是使用白名单工具完成范围明确的流程。支持工具调用格式不等于行动结果正确,执行前仍要检查参数、权限和失败路径。

硬件、许可与费用

主仓库提供 Apache 2.0 许可的 FP8 权重。模型卡给出的权重内存估计约为 78 GB,最低配置示例包含两张 80 GB A100、两张 H100 SXM5,或单张 H200、B200、B300。上下文缓存与服务框架还需要额外空间。另有 BF16 检查点,其要求不同,不能套用 FP8 的内存数字。

权重许可不收取模型订阅费,但 GPU、存储、运行维护和评估仍有成本。本词条没有把未经核实的托管 API 报价写成官方定价。

快速开始与实践流程

  1. 阅读模型卡的部署指引,确认推理框架兼容该检查点和精度。
  2. 准备简短的德英问题集,先使用保守上下文上限。
  3. 对比直接回答与检索增强回答,并核对每条引用。
  4. 验证工具调用解析、授权与错误处理,再开放实际执行。
  5. 在计划使用的并发量下记录显存、延迟和回答准确性。

常见问题与替代选择

它相当于轻量 3B 模型吗? 不是。约 3.46B 是每个 token 的激活参数,总参数约 78B,完整检查点的存储需求依然存在。

百万上下文可以替代检索吗? 不宜直接这样判断。检索能压缩输入并聚焦证据,长上下文质量需要独立于可接受长度来测量。

选择模型时可对比 Qwen3.8-Flash-Next。Ollama属于运行工具,使用前要确认对 Kolibri 的兼容性。更多选择见模型目录与开放权重标签。下一步是按官方模型卡建立小型可复现评估,判断德英推理需求是否值得投入服务器资源。

评论

还没有评论。成为第一个评论的人!