LFM 2.5-2.6B 是 Liquid AI 专为端侧智能体负载打造的开源权重稠密模型。2026 年 8 月 4 日以 lfm1.0 许可证发布,集 128K 上下文、原生工具调用和不到 2.5 GB 的内存占用于一身,面向在笔记本、手机和单卡服务器上持续运行的智能体。
核心功能
- 原生工具调用:支持 Pythonic 和 JSON 两种函数调用格式,在 Hermes Agent、OpenClaw 等真实智能体框架内完成训练。
- 128K 上下文、16 种语言:131,072 token 上下文,128,000 词表,含中文和日语。
- 端侧速度:Apple M5 Max 上 220 tok/s,AMD Ryzen AI Max+ 395 上 113 tok/s,手机上 30 tok/s,内存不到 2.5 GB。
- 服务端吞吐:高并发下单张 H100 每天约 13 亿 token。
模型规格
| 规格 | LFM 2.5-2.6B |
|---|---|
| 架构 | 稠密混合,30 层(22 短卷积 + 8 GQA),共 26.9 亿参数 |
| 上下文 | 131,072 token(128K);128,000 词表,16 种语言 |
| 预训练 | 约 34 万亿 token |
| 后训练 | 两轮 SFT、教师特化、多域在线策略蒸馏(MOPD)、智能体强化学习(GRPO) |
| 格式 | GGUF、MLX、ONNX;首发支持 llama.cpp、vLLM、SGLang、LM Studio |
| 许可证 | lfm1.0(开源权重) |
| 推荐量化 | Q4KM(1.67 GB) |
定价
LFM 2.5-2.6B 完全免费。Hugging Face 上的开源权重除了自有硬件外没有任何成本,也没有付费的官方 API 套餐。
适用场景
- 常驻本地智能体:在笔记本或手机上 7×24 小时规划并调用工具。
- 工具调用与数据提取:原生函数调用适合结构化提取与 API 编排。
- RAG 与长上下文:128K 窗口可容纳大规模文档集。
- 高吞吐服务:单张 H100 每天约 13 亿 token。
不适合智能体编程(编程是其短板),也不适合超出 26 亿参数知识容量的知识密集型任务。
优势
- 关键能力领先同级:工具调用与指令遵循领先同尺寸模型,媲美 4 倍大的模型,得益于 MOPD 蒸馏与真实智能体框架内的 GRPO 训练。
- 随处可跑:手机 30 tok/s 到 M5 Max 220 tok/s,一套栈横跨移动端、桌面与服务器。
- 开箱即部署:首发 GGUF、MLX、ONNX 构建加主流运行时支持。
- 规模化低成本:单卡高吞吐让并发智能体的服务成本保持低位。
使用技巧
- 用 Q4KM:1.67 GB,质量与体积的推荐平衡点。
- 搭配真实框架:Hermes Agent、OpenClaw 或 Pi 与其训练回路一致。
- 别用于编程智能体:编程任务请改用面向编程的模型。
总结
LFM 2.5-2.6B 是一个目标明确的 26 亿参数智能体引擎:128K 上下文、原生工具调用、几乎随处可跑的开源权重。做本地硬件上的智能体工具调用、提取、RAG 或长上下文自动化,它是同级别最强之一;要编程或深厚世界知识,请看更大的模型。
替代方案
- LFM 2.5 8B A1B:Liquid AI 同家族更大的混合 MoE。
- Qwen 3.8 27B:通用知识更强的更大开源权重选择。
- Gemma 3:Google 的开源模型家族,面向端侧与单卡场景。
相关:Claude 3.5 Sonnet、Claude 3 Haiku,分类见 models。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。