Muse Glimmer 是 Meta 于 2026 年 8 月 10 日发布的 30B 参数开源智能体多模态模型,采用 Apache 2.0 协议。它从 Meta 更大的 Muse Spark 模型蒸馏而来,专门为常驻本地智能体工作流设计:规划、工具调用、结果检查与故障恢复。模型接受文本与图片交错输入,4-bit 量化后可在单张消费级 GPU(24GB 目标)上运行,无需联网,是私有本地编程智能体的可靠默认选择。
核心功能
- 智能体原生训练:围绕智能体循环(规划、调工具、解读结果、故障恢复)构建,而非单纯聊天。
- 多模态输入:约 18 亿参数的 ViT-G/14 感知编码器,可与文本一起理解截图、图表、文档,每张图片最多 4096 个视觉 token。
- 本地运行:稠密 30B 模型(总参数约 296 亿)、131,072+ token 上下文、Apache 2.0 协议、无需联网。
- 24GB 目标:4-bit 量化让语言模型压缩到 20GB 以下,为 KV 缓存、视觉编码器与草稿模型留出 24GB/32GB 空间。
- DFlash 投机解码:2.56B 块扩散草稿模型一次前向预测 16 个 token 并由主模型并行验证;RTX 5090 上解码速度最高提升 3.1 倍。
- Day-0 生态:发布即支持 transformers、llama.cpp、vLLM、Ollama、LM Studio、SGLang、MLX、ExecuTorch。
模型规格
| 规格 | Muse Glimmer 30B |
|---|---|
| 参数量 | 约 296 亿稠密(含约 18 亿视觉编码器) |
| 上下文 | 131,072+ token |
| 模态 | 文本 + 图片输入;文本输出 |
| 语言 | 100+ |
| 协议 | Apache 2.0(权重、量化、草稿模型、编码器) |
| 硬件 | 4-bit 量化 24GB/32GB;全精度 BF16 需 55GB+ |
评测亮点
- BionicBench(LM Studio 独立评测):任务完成率 83.3%,Gemma 4 31B 与 Qwen3.6-27B 均为 77.7%。
- 智能体领先项:在 MCP Atlas、DeepSearch QA、SWE-Bench Pro 上领先对标模型。
- 权衡:在多小时长会话的 OSWorld-Verified、TerminalBench 2.1、SkillsBench 上落后于 Qwen3.6-27B。
适用场景
- 私有本地编程智能体:完全离线运行工具调用智能体,数据不出本机。
- 文档与屏幕理解:智能体边读截图、图表、文档边调用工具。
- 个人助手:Claw/Hermes 式部署,需要长程上下文与多模态感知。
- 成本敏感管线:LLM 作为裁判与重复评测类工作负载,本地运行成本极低。
优势
- 真正本地智能体:30B 多模态智能体适配单张消费级 GPU,协议完全宽松。
- 一体化技术栈:量化、投机解码、运行时协同设计,而非事后拼装。
- Meta 生态:官方 GGUF、ExecuTorch、transformers 支持,并有 AMD、Arm、Dell、Intel、NVIDIA 硬件合作伙伴。
使用技巧
- 24GB 卡先用 K-Quant-17GB:先验证纯文本性能,再逐步加入视觉与 DFlash,同时留意显存余量。
- 智能体循环里启用 DFlash:投机解码对长推理链与多步工具调用收益最大。
- 数小时终端会话选 Qwen3.6-27B:Glimmer 擅长范围明确的工具使用,超长自主运行上竞品领先。
总结
Muse Glimmer 为本地智能体开发者提供了第一个现实的默认选择:协议宽松、多模态、智能体原生的 30B 模型,能跑在已有硬件上。如果你想要不依赖云的私有常驻编码与工具调用智能体,它是当前同类中最强的开源选项。
评论
还没有评论。成为第一个评论的人!
相关工具
Muse Spark 1.2
developer.meta.com/ai/models/muse-spark
Meta 面向编码的旗舰模型,驱动 Muse Code 终端智能体:1M 上下文、更高的首试准确率、可靠的工具调用,通过 Meta Model API 提供端到端开发工作流。
GLM-5.2
z.ai
智谱 2026 年 6 月的 744B MoE 编程模型,1M 上下文、MIT 权重。现行旗舰已是后继的 GLM-5.3。
GLM-5.3
z.ai
智谱编程模型,挂在 GLM Coding Plan。复核:Lite $10、Pro $30、Max $60。公开 token 表还没有 5.3 行。不是只报 $18。
相关洞察
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
Claudesidian:让 Obsidian 变成 AI 驱动的第二大脑
通过 Claudesidian 这个开源项目,将 Obsidian 笔记系统与 Claude Code 完美结合。内置 PARA 方法、自定义命令、自动化工作流,从想法到实现的完整解决方案。