MiniCPM5-2B 是面壁智能 MiniCPM5 系列的第二款稠密模型,面向不能一直打前沿 API 的端侧助手、本地编码智能体和工具调用。 Hugging Face 模型卡 写的是标准 LlamaForCausalLM:约 2.52B 参数、42 层、GQA(16 个 Q 头、2 个 KV 头)、131,072 token 上下文。协议 Apache-2.0。r/LocalLLaMA 在 2026-09-06 标了 New Model。我们 2026-09-08 复核时 Hugging Face 显示 236 likes。仓库 OpenBMB/MiniCPM 约 10,360 star。
若要更大的本地稠密聊天模型,看 Qwen3.8-27B;若要便宜的托管中文快模型,看 GLM-5.3-Flash;若要部署/微调的 SKILL.md 包,看 MiniCPM5 Skills。
模型规格
| 规格 | MiniCPM5-2B |
|---|---|
| 类型 | 因果语言模型,稠密 Transformer |
| 参数量 | 2,516,756,480(非嵌入 1,981,982,720) |
| 层 / GQA | 42 层;16 个 Q 头,2 个 KV 头 |
| 上下文 | 131,072 token。无 RoPE scaling。 |
| 协议 | Apache-2.0 |
| 卡片日期 | Hugging Face 创建于 2026-09-06 |
限制:这是 2B 级端侧模型,不是 27B 稠密替代,也不是托管前沿 SKU。面壁自己的雷达图上,SWE-bench Pro 等编码智能体单项仍落后部分 4B 模型。
核心功能
- 卡片对比集里的 2B 开源 SOTA:面壁给出平均分 53.9,对照 LFM2.5-2.6B 33.2、Qwen3.5-2B 28.0、Gemma-4-E2B-it 24.6。这是厂商数字,不是审计。
- 原生长上下文:128k,不必再套缩放。vLLM 要用满窗口需
--max-model-len 131072。 - 工具调用:XML 风格。推荐 SGLang,加
--tool-call-parser minicpm5。 - UltraData 开源:UltraX、UltraData-Code、UltraData-SFT-Agent-2609(50 万条智能体样本)、UltraData-RL-2609。
- 格式:BF16、GGUF、MLX 4bit、GPTQ,另有 DSpark 草稿模型做推测解码。
适用场景
- 笔记本和边缘盒子,需要带工具调用的本地助手,而不是集群。
- 必须留在设备上的编码智能体,能接受 2B 级 SWE 分数。
- 已经在用 vLLM、SGLang、Ollama 或 llama.cpp 的团队,想要无需自定义 kernel 的 Llama 架构权重。
定价
权重免费。你付的是 GPU、NPU 或 CPU。
| 部分 | 价格 | 来源 2026-09-08 |
|---|---|---|
| MiniCPM5-2B 权重 | $0 | Hugging Face Apache-2.0 |
| 托管 API | 卡片未列 | 无 Inference Provider |
快速开始
- 打开 huggingface.co/openbmb/MiniCPM5-2B。
pip install "vllm>=0.21"后vllm serve openbmb/MiniCPM5-2B --port 8000,或用 SGLang>=0.5.16。- 采样:
temperature=1.0, top_p=0.95。2B 默认 Think 模式。 - 若希望智能体自己选后端,加载 MiniCPM5 Skills。
第一手资源:MiniCPM5-2B 模型卡。
常见问题
这是 MiniCPM4 吗?
不是。这是 MiniCPM5-2B,MiniCPM5 稠密系列里 1B 之后的第二款。
能在 Ollama 跑吗?
能。用 GGUF 仓库 openbmb/MiniCPM5-2B-GGUF,以及 GitHub skills 目录里的 Ollama cookbook。
能打过 Qwen3.8-27B 吗?
体量不同。MiniCPM5-2B 是端侧 2B。Qwen3.8-27B 是 27B 稠密本地模型。
替代方案
- Qwen3.8-27B:更大的本地稠密聊天。
- GLM-5.3-Flash:托管快速编码 SKU。
- DeepSeek V4 Flash:MIT MoE 智能体模型,不是端侧 2B。
使用技巧
- 引用 2.52B 参数、131k 上下文、Apache-2.0、236 HF likes,均来自 2026-09-08 复核的页面。
- 需要工具时,SGLang 不要漏
--tool-call-parser minicpm5。 lm_head未绑定:旧版 MLX 转换器若按 Llama 默认绑定嵌入,会丢掉 head。
总结
MiniCPM5-2B 是面壁当前的端侧稠密 2B:131k 上下文、Apache-2.0、标准 Llama 权重,不用 fork 就能 serve。从 Hugging Face 卡片 开始,再决定 MiniCPM5 Skills 是否已经覆盖安装路径。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。