Kolibri-1
Kolibri-1 是 Aleph Alpha 于 2026 年 10 月 3 日发布的开放权重文本推理模型,主要面向德语与英语的文档分析和工具辅助任务。它采用混合专家架构,总参数约 780 亿,每个 token 激活约 34.6 亿参数。激活量说明计算规模,却不代表部署时只需加载一个 3B 模型:完整权重仍然要进入部署系统的内存安排。
核心功能与适用场景
模型支持显式推理与工具调用。最大上下文为 1,048,576 token,但官方模型卡建议在服务效率和复杂任务上将输入控制在 262,144 token 以内;原生长上下文训练长度也是 262,144。能接受长输入与能够可靠利用每一段内容是两回事,应通过自己的任务集验证。
适合先做德英双语知识助手:从允许访问的资料中检索少量相关段落,让模型给出带来源的回答,再核对引文。另一个方向是使用白名单工具完成范围明确的流程。支持工具调用格式不等于行动结果正确,执行前仍要检查参数、权限和失败路径。
硬件、许可与费用
主仓库提供 Apache 2.0 许可的 FP8 权重。模型卡给出的权重内存估计约为 78 GB,最低配置示例包含两张 80 GB A100、两张 H100 SXM5,或单张 H200、B200、B300。上下文缓存与服务框架还需要额外空间。另有 BF16 检查点,其要求不同,不能套用 FP8 的内存数字。
权重许可不收取模型订阅费,但 GPU、存储、运行维护和评估仍有成本。本词条没有把未经核实的托管 API 报价写成官方定价。
快速开始与实践流程
- 阅读模型卡的部署指引,确认推理框架兼容该检查点和精度。
- 准备简短的德英问题集,先使用保守上下文上限。
- 对比直接回答与检索增强回答,并核对每条引用。
- 验证工具调用解析、授权与错误处理,再开放实际执行。
- 在计划使用的并发量下记录显存、延迟和回答准确性。
常见问题与替代选择
它相当于轻量 3B 模型吗? 不是。约 3.46B 是每个 token 的激活参数,总参数约 78B,完整检查点的存储需求依然存在。
百万上下文可以替代检索吗? 不宜直接这样判断。检索能压缩输入并聚焦证据,长上下文质量需要独立于可接受长度来测量。
选择模型时可对比 Qwen3.8-Flash-Next。Ollama属于运行工具,使用前要确认对 Kolibri 的兼容性。更多选择见模型目录与开放权重标签。下一步是按官方模型卡建立小型可复现评估,判断德英推理需求是否值得投入服务器资源。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
ChatGPT 额度不够用?在 Codex 里切换 DeepSeek 和 Grok
Codex Router 让你继续使用熟悉的 Codex 工作台,同时把任务交给 DeepSeek、Grok 等外部模型。看懂它怎样工作、额度怎么算,以及“不用翻墙”的前提。
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。

Obsidian CLI + Codex:把笔记库变成 Agent 的知识引擎
Obsidian CLI 让 Codex、Claude Code、Gemini CLI 等 Agent 能以可搜索、可追踪、保留双链语义的方式读写本地 Vault。本文用真实社区案例和可复制工作流说明如何搭建。