LFM 2.5-2.6B は、Liquid AI がオンデバイスのエージェントワークロード向けに開発したオープンウェイトのデンスモデルです。2026年8月4日に lfm1.0 ライセンスで公開され、128K コンテキスト、ネイティブなツール呼び出し、2.5 GB 未満のメモリフットプリントを備え、ノート PC・スマートフォン・シングル GPU サーバーで常時稼働するエージェントを対象としています。
主な機能
- ネイティブなツール呼び出し:Pythonic と JSON の2形式の関数呼び出しに対応。Hermes Agent や OpenClaw など実際のエージェントハーネス内で訓練。
- 128K コンテキスト・16言語:131,072 トークンのコンテキスト、128,000 の語彙。中国語・日本語を含む。
- オンデバイス速度:Apple M5 Max で 220 tok/s、AMD Ryzen AI Max+ 395 で 113 tok/s、スマートフォンで 30 tok/s。メモリ 2.5 GB 未満。
- サーバースループット:高並行時、単一 H100 で1日約13億トークン。
モデル仕様
| 仕様 | LFM 2.5-2.6B |
|---|---|
| アーキテクチャ | デンスハイブリッド、30 層(短畳み込み 22 + GQA 8)、総 26.9 億パラメータ |
| コンテキスト | 131,072 トークン(128K)、語彙 128,000・16言語 |
| 事前学習 | 約34兆トークン |
| 事後学習 | 2回の SFT、教師特化、マルチドメインオンポリシー蒸留(MOPD)、エージェント RL(GRPO) |
| 形式 | GGUF、MLX、ONNX。初日から llama.cpp、vLLM、SGLang、LM Studio 対応 |
| ライセンス | lfm1.0(オープンウェイト) |
| 推奨量子化 | Q4KM(1.67 GB) |
料金
LFM 2.5-2.6B は無料です。Hugging Face のオープンウェイトは自前のハードウェア以外のコストがかからず、有料の公式 API ティアもありません。
ユースケース
- 常駐ローカルエージェント:ノート PC やスマートフォンで 24 時間 365 日、計画しツールを呼び出すエージェント。
- ツール呼び出しとデータ抽出:ネイティブな関数呼び出しは構造化抽出や API オーケストレーションに適合。
- RAG と長コンテキスト:128K ウィンドウで大規模なドキュメント群を保持。
- 高スループットのサービング:単一 H100 で1日約13億トークン。
コーディングが弱みであるエージェントコーディングや、26 億パラメータの知識容量を超える知識集約型タスクには向きません。
優位性
- 重要指標でクラスをリード:ツール利用と指示追従で同サイズ帯をリードし、4倍のモデルに匹敵。MOPD 蒸留と実ハーネス内 GRPO 訓練の成果です。
- どこでも動く:スマートフォンの 30 tok/s から M5 Max の 220 tok/s まで、1つのスタックでモバイル・デスクトップ・サーバーを横断。
- すぐデプロイできる:初日からの GGUF・MLX・ONNX ビルドと主要ランタイム対応。
- スケールしても低コスト:GPU あたりの高スループットで並行エージェントのサービングコストを抑制。
ヒント
- Q4KM を使う:1.67 GB は品質とサイズの推奨バランス。
- 実際のハーネスと組み合わせる:Hermes Agent、OpenClaw、Pi は訓練時のループと一致。
- コーディングエージェントには使わない:コーディング特化モデルを選びましょう。
まとめ
LFM 2.5-2.6B は目的の絞られた 26 億パラメータのエージェントエンジンです。128K コンテキスト、ネイティブなツール呼び出し、ほぼどこでも動くオープンウェイト。ローカルハードウェアでのエージェント的なツール利用、抽出、RAG、長コンテキスト自動化なら同クラス最強の一つ。コーディングや深い世界知識が必要なら、より大きなモデルを。
代替案
- LFM 2.5 8B A1B:同ファミリーのより大きなハイブリッド MoE。
- Qwen 3.8 27B:汎用知識が強い大型オープンウェイトの選択肢。
- Gemma 3:オンデバイス・シングル GPU 向けの Google オープンモデル。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek のフラッグシップ 1.6T MoE モデル。活性化パラメータ 49B、1M トークンのコンテキスト、MIT ライセンスのオープンウェイトを備え、世界トップのコーディングスコアをクローズドモデルのごく一部の価格で実現。
Kimi K3
www.kimi.com
Moonshot AI のオープンウェイト 2.8T パラメータ多モーダルエージェントモデル。1M トークンのコンテキストを備えた世界初のオープン 3T 級モデルで、コーディングとエージェントのベンチマークでクローズド最先端に迫る。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA の効率的なオープンウェイトモデル。総パラメータ 30B で活性化はわずか 3B。MoE ハイブリッド構成、最大 1M トークンのコンテキスト、単一 GPU 展開でローカル推論とポストトレーニング研究に対応。
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。
Obsidian を OpenClaw に接続したら、意思決定まで手伝い始めた
Obsidian がただのノート置き場ではなく OpenClaw とつながったとき、情報整理、文脈接続、判断材料の整理、そして実際の意思決定支援まで始まった。