Muse Glimmer 是 Meta 于 2026 年 8 月 10 日发布的 30B 参数开源智能体多模态模型,采用 Apache 2.0 协议。它从 Meta 更大的 Muse Spark 模型蒸馏而来,专门为常驻本地智能体工作流设计:规划、工具调用、结果检查与故障恢复。模型接受文本与图片交错输入,4-bit 量化后可在单张消费级 GPU(24GB 目标)上运行,无需联网,是私有本地编程智能体的可靠默认选择。
核心功能
- 智能体原生训练:围绕智能体循环(规划、调工具、解读结果、故障恢复)构建,而非单纯聊天。
- 多模态输入:约 18 亿参数的 ViT-G/14 感知编码器,可与文本一起理解截图、图表、文档,每张图片最多 4096 个视觉 token。
- 本地运行:稠密 30B 模型(总参数约 296 亿)、131,072+ token 上下文、Apache 2.0 协议、无需联网。
- 24GB 目标:4-bit 量化让语言模型压缩到 20GB 以下,为 KV 缓存、视觉编码器与草稿模型留出 24GB/32GB 空间。
- DFlash 投机解码:2.56B 块扩散草稿模型一次前向预测 16 个 token 并由主模型并行验证;RTX 5090 上解码速度最高提升 3.1 倍。
- Day-0 生态:发布即支持 transformers、llama.cpp、vLLM、Ollama、LM Studio、SGLang、MLX、ExecuTorch。
模型规格
| 规格 | Muse Glimmer 30B |
|---|---|
| 参数量 | 约 296 亿稠密(含约 18 亿视觉编码器) |
| 上下文 | 131,072+ token |
| 模态 | 文本 + 图片输入;文本输出 |
| 语言 | 100+ |
| 协议 | Apache 2.0(权重、量化、草稿模型、编码器) |
| 硬件 | 4-bit 量化 24GB/32GB;全精度 BF16 需 55GB+ |
评测亮点
- BionicBench(LM Studio 独立评测):任务完成率 83.3%,Gemma 4 31B 与 Qwen3.6-27B 均为 77.7%。
- 智能体领先项:在 MCP Atlas、DeepSearch QA、SWE-Bench Pro 上领先对标模型。
- 权衡:在多小时长会话的 OSWorld-Verified、TerminalBench 2.1、SkillsBench 上落后于 Qwen3.6-27B。
适用场景
- 私有本地编程智能体:完全离线运行工具调用智能体,数据不出本机。
- 文档与屏幕理解:智能体边读截图、图表、文档边调用工具。
- 个人助手:Claw/Hermes 式部署,需要长程上下文与多模态感知。
- 成本敏感管线:LLM 作为裁判与重复评测类工作负载,本地运行成本极低。
优势
- 真正本地智能体:30B 多模态智能体适配单张消费级 GPU,协议完全宽松。
- 一体化技术栈:量化、投机解码、运行时协同设计,而非事后拼装。
- Meta 生态:官方 GGUF、ExecuTorch、transformers 支持,并有 AMD、Arm、Dell、Intel、NVIDIA 硬件合作伙伴。
使用技巧
- 24GB 卡先用 K-Quant-17GB:先验证纯文本性能,再逐步加入视觉与 DFlash,同时留意显存余量。
- 智能体循环里启用 DFlash:投机解码对长推理链与多步工具调用收益最大。
- 数小时终端会话选 Qwen3.6-27B:Glimmer 擅长范围明确的工具使用,超长自主运行上竞品领先。
总结
Muse Glimmer 为本地智能体开发者提供了第一个现实的默认选择:协议宽松、多模态、智能体原生的 30B 模型,能跑在已有硬件上。如果你想要不依赖云的私有常驻编码与工具调用智能体,它是当前同类中最强的开源选项。
评论
还没有评论。成为第一个评论的人!
相关工具
Muse Spark 1.2
developer.meta.com/ai/models/muse-spark
Meta 面向编码的旗舰模型,驱动 Muse Code 终端智能体:1M 上下文、更高的首试准确率、可靠的工具调用,通过 Meta Model API 提供端到端开发工作流。
GLM-5.2
z.ai
智谱 AI 旗舰 744B MoE 编码模型:扎实的 1M 上下文、MIT 开源权重、双档思考强度,长程智能体编程性能约为 GPT-5.5 的六分之一价格。
Meta Llama 3.2 Vision
www.llama.com
Meta 最新多模态大语言模型,支持图像推理,提供 11B 和 90B 两个版本。
相关洞察
我把 Obsidian 接入 OpenClaw 后,它开始帮我做决策
当 Obsidian 不再只是记笔记,而是接入 OpenClaw 之后,它开始帮我整理信息、连接上下文、推动判断,甚至参与真实决策。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。
低代码平台的黄昏:为什么 Claude Agent SDK 会让 Dify 们成为历史
从大模型第一性原理深度剖析为什么 Claude Agent SDK 将取代 Dify。探讨为什么自然语言描述流程比图形化编排更符合人类原始行为模式,以及为什么这是 AI 时代的必然选择。