LFM 2.5-2.6B は、Liquid AI がオンデバイスのエージェントワークロード向けに開発したオープンウェイトのデンスモデルです。2026年8月4日に lfm1.0 ライセンスで公開され、128K コンテキスト、ネイティブなツール呼び出し、2.5 GB 未満のメモリフットプリントを備え、ノート PC・スマートフォン・シングル GPU サーバーで常時稼働するエージェントを対象としています。
主な機能
- ネイティブなツール呼び出し:Pythonic と JSON の2形式の関数呼び出しに対応。Hermes Agent や OpenClaw など実際のエージェントハーネス内で訓練。
- 128K コンテキスト・16言語:131,072 トークンのコンテキスト、128,000 の語彙。中国語・日本語を含む。
- オンデバイス速度:Apple M5 Max で 220 tok/s、AMD Ryzen AI Max+ 395 で 113 tok/s、スマートフォンで 30 tok/s。メモリ 2.5 GB 未満。
- サーバースループット:高並行時、単一 H100 で1日約13億トークン。
モデル仕様
| 仕様 | LFM 2.5-2.6B |
|---|---|
| アーキテクチャ | デンスハイブリッド、30 層(短畳み込み 22 + GQA 8)、総 26.9 億パラメータ |
| コンテキスト | 131,072 トークン(128K)、語彙 128,000・16言語 |
| 事前学習 | 約34兆トークン |
| 事後学習 | 2回の SFT、教師特化、マルチドメインオンポリシー蒸留(MOPD)、エージェント RL(GRPO) |
| 形式 | GGUF、MLX、ONNX。初日から llama.cpp、vLLM、SGLang、LM Studio 対応 |
| ライセンス | lfm1.0(オープンウェイト) |
| 推奨量子化 | Q4KM(1.67 GB) |
料金
LFM 2.5-2.6B は無料です。Hugging Face のオープンウェイトは自前のハードウェア以外のコストがかからず、有料の公式 API ティアもありません。
ユースケース
- 常駐ローカルエージェント:ノート PC やスマートフォンで 24 時間 365 日、計画しツールを呼び出すエージェント。
- ツール呼び出しとデータ抽出:ネイティブな関数呼び出しは構造化抽出や API オーケストレーションに適合。
- RAG と長コンテキスト:128K ウィンドウで大規模なドキュメント群を保持。
- 高スループットのサービング:単一 H100 で1日約13億トークン。
コーディングが弱みであるエージェントコーディングや、26 億パラメータの知識容量を超える知識集約型タスクには向きません。
優位性
- 重要指標でクラスをリード:ツール利用と指示追従で同サイズ帯をリードし、4倍のモデルに匹敵。MOPD 蒸留と実ハーネス内 GRPO 訓練の成果です。
- どこでも動く:スマートフォンの 30 tok/s から M5 Max の 220 tok/s まで、1つのスタックでモバイル・デスクトップ・サーバーを横断。
- すぐデプロイできる:初日からの GGUF・MLX・ONNX ビルドと主要ランタイム対応。
- スケールしても低コスト:GPU あたりの高スループットで並行エージェントのサービングコストを抑制。
ヒント
- Q4KM を使う:1.67 GB は品質とサイズの推奨バランス。
- 実際のハーネスと組み合わせる:Hermes Agent、OpenClaw、Pi は訓練時のループと一致。
- コーディングエージェントには使わない:コーディング特化モデルを選びましょう。
まとめ
LFM 2.5-2.6B は目的の絞られた 26 億パラメータのエージェントエンジンです。128K コンテキスト、ネイティブなツール呼び出し、ほぼどこでも動くオープンウェイト。ローカルハードウェアでのエージェント的なツール利用、抽出、RAG、長コンテキスト自動化なら同クラス最強の一つ。コーディングや深い世界知識が必要なら、より大きなモデルを。
代替案
- LFM 2.5 8B A1B:同ファミリーのより大きなハイブリッド MoE。
- Qwen 3.8 27B:汎用知識が強い大型オープンウェイトの選択肢。
- Gemma 3:オンデバイス・シングル GPU 向けの Google オープンモデル。
使用シナリオ
- LFM 2.5-2.6B が自分のワークフローをカバーするか先に確認したい場合。
関連:Claude 3.5 Sonnet、Claude 3 Haiku。分類は models。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。