Muse Glimmer 是 Meta 于 2026 年 8 月 10 日发布的 30B 参数开源智能体多模态模型,采用 Apache 2.0 协议。它从 Meta 更大的 Muse Spark 模型蒸馏而来,专门为常驻本地智能体工作流设计:规划、工具调用、结果检查与故障恢复。模型接受文本与图片交错输入,4-bit 量化后可在单张消费级 GPU(24GB 目标)上运行,无需联网,是私有本地编程智能体的可靠默认选择。
核心功能
- 智能体原生训练:围绕智能体循环(规划、调工具、解读结果、故障恢复)构建,而非单纯聊天。
- 多模态输入:约 18 亿参数的 ViT-G/14 感知编码器,可与文本一起理解截图、图表、文档,每张图片最多 4096 个视觉 token。
- 本地运行:稠密 30B 模型(总参数约 296 亿)、131,072+ token 上下文、Apache 2.0 协议、无需联网。
- 24GB 目标:4-bit 量化让语言模型压缩到 20GB 以下,为 KV 缓存、视觉编码器与草稿模型留出 24GB/32GB 空间。
- DFlash 投机解码:2.56B 块扩散草稿模型一次前向预测 16 个 token 并由主模型并行验证;RTX 5090 上解码速度最高提升 3.1 倍。
- Day-0 生态:发布即支持 transformers、llama.cpp、vLLM、Ollama、LM Studio、SGLang、MLX、ExecuTorch。
模型规格
| 规格 | Muse Glimmer 30B |
|---|---|
| 参数量 | 约 296 亿稠密(含约 18 亿视觉编码器) |
| 上下文 | 131,072+ token |
| 模态 | 文本 + 图片输入;文本输出 |
| 语言 | 100+ |
| 协议 | Apache 2.0(权重、量化、草稿模型、编码器) |
| 硬件 | 4-bit 量化 24GB/32GB;全精度 BF16 需 55GB+ |
评测亮点
- BionicBench(LM Studio 独立评测):任务完成率 83.3%,Gemma 4 31B 与 Qwen3.6-27B 均为 77.7%。
- 智能体领先项:在 MCP Atlas、DeepSearch QA、SWE-Bench Pro 上领先对标模型。
- 权衡:在多小时长会话的 OSWorld-Verified、TerminalBench 2.1、SkillsBench 上落后于 Qwen3.6-27B。
适用场景
- 私有本地编程智能体:完全离线运行工具调用智能体,数据不出本机。
- 文档与屏幕理解:智能体边读截图、图表、文档边调用工具。
- 个人助手:Claw/Hermes 式部署,需要长程上下文与多模态感知。
- 成本敏感管线:LLM 作为裁判与重复评测类工作负载,本地运行成本极低。
优势
- 真正本地智能体:30B 多模态智能体适配单张消费级 GPU,协议完全宽松。
- 一体化技术栈:量化、投机解码、运行时协同设计,而非事后拼装。
- Meta 生态:官方 GGUF、ExecuTorch、transformers 支持,并有 AMD、Arm、Dell、Intel、NVIDIA 硬件合作伙伴。
使用技巧
- 24GB 卡先用 K-Quant-17GB:先验证纯文本性能,再逐步加入视觉与 DFlash,同时留意显存余量。
- 智能体循环里启用 DFlash:投机解码对长推理链与多步工具调用收益最大。
- 数小时终端会话选 Qwen3.6-27B:Glimmer 擅长范围明确的工具使用,超长自主运行上竞品领先。
总结
Muse Glimmer 为本地智能体开发者提供了第一个现实的默认选择:协议宽松、多模态、智能体原生的 30B 模型,能跑在已有硬件上。如果你想要不依赖云的私有常驻编码与工具调用智能体,它是当前同类中最强的开源选项。
相关:Claude 3.5 Sonnet、Claude 3 Haiku,分类见 models。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
Codex 接入任意模型:一个 magpie,不用再装 Codex Router
免费开源的菜单栏应用 magpie 在本机跑一个网关,把 OpenRouter、DeepSeek 这类按 key 计费的供应商和 ChatGPT、Claude、Cursor、Grok、Copilot 的订阅,一起塞进 Codex 的原生模型选择器,一键切换,不用再装 Codex Router。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。