Laguna S 2.1 logo

Laguna S 2.1

打开

Poolside 开源权重编程模型:118B 总参 / 8B 激活 MoE、100 万 token 上下文、原生交错推理、OpenMDW-1.1 协议,专为智能体编程与长程任务打造。

分享:

Laguna S 2.1 是 Poolside 于 2026 年 7 月 21 日发布的开源权重编程模型,发布当天权重即上架 Hugging Face。它采用 118B 总参、每 token 仅激活 8B 的 MoE 架构,配备 100 万 token 上下文窗口和原生交错推理能力,专为智能体编程和长程任务设计。模型采用 OpenMDW-1.1 协议,商用与非商用均免费。在 Laguna 家族中,它介于 Laguna XS 2.1(33B-A3B)和 Laguna M.1(225B-A23B)之间。

模型规格

规格 Laguna S 2.1
参数 118B 总参 / 每 token 激活 8B(MoE)
专家 256 个路由专家(top-10)+ 1 个共享专家,token-choice 路由器配 softplus 门控
层数 48 层(12 层全局注意力,36 层滑动窗口注意力,窗口 512)
注意力 分组查询注意力(GQA),8 个 KV 头,head dim 128
上下文 1,048,576 token(思考与非思考模式均为 1M)
词表 100,352 token,纯文本输入输出(无视觉)
训练 自研训练,30T token,从开训到发布不足 9 周
协议 OpenMDW-1.1(商用与非商用免费)

核心功能

  • 原生交错推理:思考过程穿插在工具调用之间,通过 enable_thinking 按请求控制;推理只有关闭和 max 两档,没有 low / medium / high 分级。
  • 全模式 1M 上下文:思考与非思考模式都可使用完整的 1,048,576 token 窗口,整个仓库和长篇智能体轨迹都能装进一个会话。
  • 发布当天开放权重:BF16、FP8、INT4、NVFP4、GGUF、MLX 等格式同步上架 Hugging Face,并附带用于投机解码的 DFlash 草稿模型。仓库下载量约 11.9 万次、点赞约 969。
  • 单台工作站即可运行:模型可在一台 128GB 统一内存的 NVIDIA DGX Spark 上运行。
  • 服务栈广泛:Poolside 的 pool CLI、vLLM、SGLang、Ollama、llama.cpp、MLX、TensorRT-LLM 均可运行。

适用场景

  • 智能体编程:为多步工具调用、终端操作和仓库级修改而生。在 Terminal-Bench 2.1 和 SWE-Bench Pro 上,它追平或超越了数倍于自身规模的模型,包括 DeepSeek-V4-Flash、NVIDIA Nemotron 3 Ultra 和 Thinking Machines Inkling。
  • 长程任务:1M 窗口加上交错推理,让长时间的调试与重构会话在数十轮工具调用后依然保持连贯。
  • 本地部署:OpenMDW-1.1 权重与 4-bit 量化,使其能在一台 DGX Spark 上自托管,适合对隐私敏感的代码库。

定价

权重在 OpenMDW-1.1 协议下免费。托管接入方式:

渠道 方案
Poolside API Poolside 官方托管接入
OpenRouter(免费端点) 免费,256K 上下文
OpenRouter(专属端点) 1M 上下文,每 1M token:输入 $0.10 / 输出 $0.20 / 缓存读取 $0.01
Baseten Model Library 与 Frontier Gateway
Vercel AI Gateway 托管渠道之一

相比竞品的优势

  1. 激活参数效率:仅 8B 激活参数,却在 Terminal-Bench 2.1 和 SWE-Bench Pro 上与大得多的模型同台竞技。
  2. 真正可商用的开放:OpenMDW-1.1 无需额外协议即可商用,且所有主流量化格式发布当天齐备。
  3. 本地优先的 1M 上下文:很少有开源模型能把 1M 窗口和单台 DGX Spark 部署结合在一起。

快速开始

  1. 托管试用:OpenRouter 免费端点(256K 上下文)是最快的上手方式;Poolside API 与 Vercel AI Gateway 也已接入。
  2. 下载权重:在 Hugging Face 选择 BF16、FP8、INT4、NVFP4、GGUF 或 MLX 版本。
  3. 本地运行:使用 pool CLI、vLLM、SGLang、Ollama、llama.cpp、MLX 或 TensorRT-LLM。
  4. 控制推理:按请求设置 enable_thinking;开启后即为 max 强度。

常见问题

Laguna S 2.1 可以商用吗?

可以。OpenMDW-1.1 协议覆盖商用与非商用,OpenRouter 还提供 256K 上下文的免费托管端点。

本地运行需要什么硬件?

一台 NVIDIA DGX Spark(128GB 统一内存)即可运行;INT4、NVFP4 或 GGUF 量化版本通过 llama.cpp、MLX 或 TensorRT-LLM 可进一步降低占用。

支持图片或视觉输入吗?

不支持。Laguna S 2.1 是纯文本模型,词表 100,352 token,没有视觉编码器。

替代方案

  • DeepSeek V4 Flash:体量更大的 284B-A13B 开源智能体模型,MIT 权重,API 价格低廉。
  • Qwen3.8-27B:Apache 2.0 协议的 27B 稠密模型,适合更简单的本地部署。

使用技巧

  1. 困难任务开启思考enable_thinking 以 max 强度运行,并在工具调用之间穿插推理,这正是其智能体能力增益的来源。
  2. 使用 DFlash 草稿模型:搭配官方 DFlash 草稿做投机解码,本地服务速度明显提升。
  3. 吃满整个窗口:两种模式都有 1M token,把整个仓库和完整工具历史留在上下文里,而不是切片处理。

总结

Laguna S 2.1 是 2026 年最实用的开源编程模型之一:118B MoE 仅激活 8B、真正的 1M token 上下文、发布当天齐备的量化格式,以及允许商用的协议。如果你想在自己的硬件上或以极低的 API 成本获得接近前沿的智能体编程能力,它值得认真考虑。

评论

还没有评论。成为第一个评论的人!