MiniCPM5-2B は OpenBMB の MiniCPM5 密モデル第 2 弾で、フロンティア API を常時叩けないオンデバイス助手、ローカルコーディングエージェント、ツール呼び出し向けです。Hugging Face カード は標準の LlamaForCausalLM を記載します。パラメータ約 2.52B、42 層、GQA(Q ヘッド 16、KV ヘッド 2)、コンテキスト 131,072 トークン。ライセンスは Apache-2.0。r/LocalLLaMA は 2026-09-06 に New Model としました。2026-09-08 再確認時、Hugging Face は 236 likes。リポジトリ OpenBMB/MiniCPM は約 10,360 stars。
より大きな密のローカルチャットなら Qwen3.8-27B、安価なホスト型中国語高速 SKU なら GLM-5.3-Flash、デプロイとファインチューンの SKILL.md パックなら MiniCPM5 Skills を見てください。
モデル仕様
| 仕様 | MiniCPM5-2B |
|---|---|
| 種別 | Causal LM、密 Transformer |
| パラメータ | 2,516,756,480(非埋め込み 1,981,982,720) |
| 層 / GQA | 42 層、Q 16 / KV 2 |
| コンテキスト | 131,072 トークン。RoPE scaling なし。 |
| ライセンス | Apache-2.0 |
| カード日付 | Hugging Face 作成 2026-09-06 |
制約: 2B クラスのオンデバイスモデルです。27B 密の代替でも、ホスト型フロンティア SKU でもありません。OpenBMB 自身のレーダーでも SWE-bench Pro など一部のコーディングエージェント項目は 4B に劣ります。
主な機能
- カード比較セットでの 2B オープンソース SOTA: OpenBMB 平均 53.9。LFM2.5-2.6B 33.2、Qwen3.5-2B 28.0、Gemma-4-E2B-it 24.6。ベンダー数字であり監査ではありません。
- ネイティブ長コンテキスト: 128k。フル窓は vLLM で
--max-model-len 131072。 - ツール呼び出し: XML 形式。推奨バックエンドは SGLang の
--tool-call-parser minicpm5。 - UltraData 公開: UltraX、UltraData-Code、UltraData-SFT-Agent-2609(エージェント 50 万件)、UltraData-RL-2609。
- 形式: BF16、GGUF、MLX 4bit、GPTQ、推測デコード用 DSpark ドラフト。
使用シナリオ
- ノート PC とエッジ箱で、クラスタではなくツール付きローカル助手が欲しい場合。
- デバイス内に留めたいコーディングエージェントで、2B 級の SWE スコアを許容できる場合。
- 既に vLLM、SGLang、Ollama、llama.cpp を使っており、カスタムカーネルなしの Llama アーキテクチャが欲しいチーム。
料金
重みは無料。払うのは GPU、NPU、CPU です。
| 項目 | 価格 | 出典 2026-09-08 |
|---|---|---|
| MiniCPM5-2B 重み | $0 | Hugging Face Apache-2.0 |
| ホスト API | カード未記載 | Inference Provider なし |
はじめに
- huggingface.co/openbmb/MiniCPM5-2B を開く。
pip install "vllm>=0.21"のあとvllm serve openbmb/MiniCPM5-2B --port 8000、または SGLang>=0.5.16。- サンプリングは
temperature=1.0, top_p=0.95。2B の既定は Think モード。 - エージェントにバックエンドを選ばせるなら MiniCPM5 Skills を載せる。
第一ソース: MiniCPM5-2B モデルカード。
よくある質問
MiniCPM4 ですか?
違います。MiniCPM5-1B に続く MiniCPM5 密モデルの 2B です。
Ollama で動きますか?
動きます。GGUF の openbmb/MiniCPM5-2B-GGUF と GitHub skills の Ollama cookbook を使います。
Qwen3.8-27B より強いですか?
サイズが違います。MiniCPM5-2B はオンデバイス 2B。Qwen3.8-27B は 27B 密のローカルモデルです。
代替案
- Qwen3.8-27B: より大きな密チャット。
- GLM-5.3-Flash: ホスト型の速いコーディング SKU。
- DeepSeek V4 Flash: MIT の MoE エージェント。オンデバイス 2B ではない。
ヒント
- 2.52B、131k、Apache-2.0、236 HF likes は 2026-09-08 に確認したページから。
- ツールが必要なら SGLang で
--tool-call-parser minicpm5を落とさない。 - 非タイの
lm_head: 古い MLX 変換器が Llama のタイ埋め込み前提だと head を捨てます。
まとめ
MiniCPM5-2B は OpenBMB の現行オンデバイス密 2B です。131k コンテキスト、Apache-2.0、フォークなしで serve できる Llama チェックポイント。Hugging Face カード から始め、MiniCPM5 Skills が導入経路を既に覆っているか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
Claude Skills 完全ガイド - 必須10大 Skills 徹底解説
Claude Skills の拡張メカニズムを深掘りし、10の中核スキルと Obsidian 連携を詳しく解説。高効率な AI ワークフロー構築を支援します
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。