Laguna S 2.1 是 Poolside 于 2026 年 7 月 21 日发布的开源权重编程模型,发布当天权重即上架 Hugging Face。它采用 118B 总参、每 token 仅激活 8B 的 MoE 架构,配备 100 万 token 上下文窗口和原生交错推理能力,专为智能体编程和长程任务设计。模型采用 OpenMDW-1.1 协议,商用与非商用均免费。在 Laguna 家族中,它介于 Laguna XS 2.1(33B-A3B)和 Laguna M.1(225B-A23B)之间。
模型规格
| 规格 | Laguna S 2.1 |
|---|---|
| 参数 | 118B 总参 / 每 token 激活 8B(MoE) |
| 专家 | 256 个路由专家(top-10)+ 1 个共享专家,token-choice 路由器配 softplus 门控 |
| 层数 | 48 层(12 层全局注意力,36 层滑动窗口注意力,窗口 512) |
| 注意力 | 分组查询注意力(GQA),8 个 KV 头,head dim 128 |
| 上下文 | 1,048,576 token(思考与非思考模式均为 1M) |
| 词表 | 100,352 token,纯文本输入输出(无视觉) |
| 训练 | 自研训练,30T token,从开训到发布不足 9 周 |
| 协议 | OpenMDW-1.1(商用与非商用免费) |
核心功能
- 原生交错推理:思考过程穿插在工具调用之间,通过
enable_thinking按请求控制;推理只有关闭和 max 两档,没有 low / medium / high 分级。 - 全模式 1M 上下文:思考与非思考模式都可使用完整的 1,048,576 token 窗口,整个仓库和长篇智能体轨迹都能装进一个会话。
- 发布当天开放权重:BF16、FP8、INT4、NVFP4、GGUF、MLX 等格式同步上架 Hugging Face,并附带用于投机解码的 DFlash 草稿模型。仓库下载量约 11.9 万次、点赞约 969。
- 单台工作站即可运行:模型可在一台 128GB 统一内存的 NVIDIA DGX Spark 上运行。
- 服务栈广泛:Poolside 的
poolCLI、vLLM、SGLang、Ollama、llama.cpp、MLX、TensorRT-LLM 均可运行。
适用场景
- 智能体编程:为多步工具调用、终端操作和仓库级修改而生。在 Terminal-Bench 2.1 和 SWE-Bench Pro 上,它追平或超越了数倍于自身规模的模型,包括 DeepSeek-V4-Flash、NVIDIA Nemotron 3 Ultra 和 Thinking Machines Inkling。
- 长程任务:1M 窗口加上交错推理,让长时间的调试与重构会话在数十轮工具调用后依然保持连贯。
- 本地部署:OpenMDW-1.1 权重与 4-bit 量化,使其能在一台 DGX Spark 上自托管,适合对隐私敏感的代码库。
定价
权重在 OpenMDW-1.1 协议下免费。托管接入方式:
| 渠道 | 方案 |
|---|---|
| Poolside API | Poolside 官方托管接入 |
| OpenRouter(免费端点) | 免费,256K 上下文 |
| OpenRouter(专属端点) | 1M 上下文,每 1M token:输入 $0.10 / 输出 $0.20 / 缓存读取 $0.01 |
| Baseten | Model Library 与 Frontier Gateway |
| Vercel AI Gateway | 托管渠道之一 |
相比竞品的优势
- 激活参数效率:仅 8B 激活参数,却在 Terminal-Bench 2.1 和 SWE-Bench Pro 上与大得多的模型同台竞技。
- 真正可商用的开放:OpenMDW-1.1 无需额外协议即可商用,且所有主流量化格式发布当天齐备。
- 本地优先的 1M 上下文:很少有开源模型能把 1M 窗口和单台 DGX Spark 部署结合在一起。
快速开始
- 托管试用:OpenRouter 免费端点(256K 上下文)是最快的上手方式;Poolside API 与 Vercel AI Gateway 也已接入。
- 下载权重:在 Hugging Face 选择 BF16、FP8、INT4、NVFP4、GGUF 或 MLX 版本。
- 本地运行:使用
poolCLI、vLLM、SGLang、Ollama、llama.cpp、MLX 或 TensorRT-LLM。 - 控制推理:按请求设置
enable_thinking;开启后即为 max 强度。
常见问题
Laguna S 2.1 可以商用吗?
可以。OpenMDW-1.1 协议覆盖商用与非商用,OpenRouter 还提供 256K 上下文的免费托管端点。
本地运行需要什么硬件?
一台 NVIDIA DGX Spark(128GB 统一内存)即可运行;INT4、NVFP4 或 GGUF 量化版本通过 llama.cpp、MLX 或 TensorRT-LLM 可进一步降低占用。
支持图片或视觉输入吗?
不支持。Laguna S 2.1 是纯文本模型,词表 100,352 token,没有视觉编码器。
替代方案
- DeepSeek V4 Flash:体量更大的 284B-A13B 开源智能体模型,MIT 权重,API 价格低廉。
- Qwen3.8-27B:Apache 2.0 协议的 27B 稠密模型,适合更简单的本地部署。
使用技巧
- 困难任务开启思考:
enable_thinking以 max 强度运行,并在工具调用之间穿插推理,这正是其智能体能力增益的来源。 - 使用 DFlash 草稿模型:搭配官方 DFlash 草稿做投机解码,本地服务速度明显提升。
- 吃满整个窗口:两种模式都有 1M token,把整个仓库和完整工具历史留在上下文里,而不是切片处理。
总结
Laguna S 2.1 是 2026 年最实用的开源编程模型之一:118B MoE 仅激活 8B、真正的 1M token 上下文、发布当天齐备的量化格式,以及允许商用的协议。如果你想在自己的硬件上或以极低的 API 成本获得接近前沿的智能体编程能力,它值得认真考虑。
评论
还没有评论。成为第一个评论的人!
相关工具
KAT-Coder V2.5
huggingface.co/Kwaipilot/KAT-Coder-V2.5-Dev
Kwaipilot 开源智能体编程模型:35B MoE、每 token 激活 3B,基于 Qwen3.6 基座,Apache 2.0 协议,原生 262K 上下文,PinchBench 工具调用榜首。
NVIDIA Nemotron 3.5 Lightning 30B A3B
build.nvidia.com/nvidia/nemotron-3.5-lightning-30b-a3b
NVIDIA 高效开源权重模型,30B 总参数仅激活 3B,MoE 混合架构,最长 1M token 上下文,单卡部署,适合本地推理、编码与后训练研究。
Claude Opus 5
www.anthropic.com/claude/opus
Anthropic 前沿 Opus 级模型,1M token 上下文与可调思考强度,以 Opus 4.8 的价格带来接近 Fable 5 的智能水平,适合智能体与长周期编码任务。
相关洞察
6 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。