LFM 2.5-2.6B 是 Liquid AI 专为端侧智能体负载打造的开源权重稠密模型。2026 年 8 月 4 日以 lfm1.0 许可证发布,集 128K 上下文、原生工具调用和不到 2.5 GB 的内存占用于一身,面向在笔记本、手机和单卡服务器上持续运行的智能体。
核心功能
- 原生工具调用:支持 Pythonic 和 JSON 两种函数调用格式,在 Hermes Agent、OpenClaw 等真实智能体框架内完成训练。
- 128K 上下文、16 种语言:131,072 token 上下文,128,000 词表,含中文和日语。
- 端侧速度:Apple M5 Max 上 220 tok/s,AMD Ryzen AI Max+ 395 上 113 tok/s,手机上 30 tok/s,内存不到 2.5 GB。
- 服务端吞吐:高并发下单张 H100 每天约 13 亿 token。
模型规格
| 规格 | LFM 2.5-2.6B |
|---|---|
| 架构 | 稠密混合,30 层(22 短卷积 + 8 GQA),共 26.9 亿参数 |
| 上下文 | 131,072 token(128K);128,000 词表,16 种语言 |
| 预训练 | 约 34 万亿 token |
| 后训练 | 两轮 SFT、教师特化、多域在线策略蒸馏(MOPD)、智能体强化学习(GRPO) |
| 格式 | GGUF、MLX、ONNX;首发支持 llama.cpp、vLLM、SGLang、LM Studio |
| 许可证 | lfm1.0(开源权重) |
| 推荐量化 | Q4KM(1.67 GB) |
定价
LFM 2.5-2.6B 完全免费。Hugging Face 上的开源权重除了自有硬件外没有任何成本,也没有付费的官方 API 套餐。
适用场景
- 常驻本地智能体:在笔记本或手机上 7×24 小时规划并调用工具。
- 工具调用与数据提取:原生函数调用适合结构化提取与 API 编排。
- RAG 与长上下文:128K 窗口可容纳大规模文档集。
- 高吞吐服务:单张 H100 每天约 13 亿 token。
不适合智能体编程(编程是其短板),也不适合超出 26 亿参数知识容量的知识密集型任务。
优势
- 关键能力领先同级:工具调用与指令遵循领先同尺寸模型,媲美 4 倍大的模型,得益于 MOPD 蒸馏与真实智能体框架内的 GRPO 训练。
- 随处可跑:手机 30 tok/s 到 M5 Max 220 tok/s,一套栈横跨移动端、桌面与服务器。
- 开箱即部署:首发 GGUF、MLX、ONNX 构建加主流运行时支持。
- 规模化低成本:单卡高吞吐让并发智能体的服务成本保持低位。
使用技巧
- 用 Q4KM:1.67 GB,质量与体积的推荐平衡点。
- 搭配真实框架:Hermes Agent、OpenClaw 或 Pi 与其训练回路一致。
- 别用于编程智能体:编程任务请改用面向编程的模型。
总结
LFM 2.5-2.6B 是一个目标明确的 26 亿参数智能体引擎:128K 上下文、原生工具调用、几乎随处可跑的开源权重。做本地硬件上的智能体工具调用、提取、RAG 或长上下文自动化,它是同级别最强之一;要编程或深厚世界知识,请看更大的模型。
替代方案
- LFM 2.5 8B A1B:Liquid AI 同家族更大的混合 MoE。
- Qwen 3.8 27B:通用知识更强的更大开源权重选择。
- Gemma 3:Google 的开源模型家族,面向端侧与单卡场景。
评论
还没有评论。成为第一个评论的人!
相关工具
DeepSeek V4 Pro 0813
www.deepseek.com
DeepSeek 旗舰 1.6T MoE 模型,激活参数 49B,1M token 上下文,MIT 协议开源权重,LiveCodeBench 编码得分全球第一,定价仅为封闭前沿模型的零头。
Kimi K3
www.kimi.com
月之暗面(Moonshot AI)开源的 2.8T 参数多模态智能体模型,1M token 上下文,全球首个开源 3T 级模型,在编码与智能体基准上逼近封闭前沿模型。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。