Muse Glimmer logo

Muse Glimmer

打开

Meta 开源 30B 智能体多模态模型:从 Muse Spark 蒸馏,专为本地常驻编码与工具调用智能体设计,单张消费级 GPU 即可运行。

分享:

Muse Glimmer 是 Meta 于 2026 年 8 月 10 日发布的 30B 参数开源智能体多模态模型,采用 Apache 2.0 协议。它从 Meta 更大的 Muse Spark 模型蒸馏而来,专门为常驻本地智能体工作流设计:规划、工具调用、结果检查与故障恢复。模型接受文本与图片交错输入,4-bit 量化后可在单张消费级 GPU(24GB 目标)上运行,无需联网,是私有本地编程智能体的可靠默认选择。

核心功能

  • 智能体原生训练:围绕智能体循环(规划、调工具、解读结果、故障恢复)构建,而非单纯聊天。
  • 多模态输入:约 18 亿参数的 ViT-G/14 感知编码器,可与文本一起理解截图、图表、文档,每张图片最多 4096 个视觉 token。
  • 本地运行:稠密 30B 模型(总参数约 296 亿)、131,072+ token 上下文、Apache 2.0 协议、无需联网。
  • 24GB 目标:4-bit 量化让语言模型压缩到 20GB 以下,为 KV 缓存、视觉编码器与草稿模型留出 24GB/32GB 空间。
  • DFlash 投机解码:2.56B 块扩散草稿模型一次前向预测 16 个 token 并由主模型并行验证;RTX 5090 上解码速度最高提升 3.1 倍。
  • Day-0 生态:发布即支持 transformers、llama.cpp、vLLM、Ollama、LM Studio、SGLang、MLX、ExecuTorch。

模型规格

规格 Muse Glimmer 30B
参数量 约 296 亿稠密(含约 18 亿视觉编码器)
上下文 131,072+ token
模态 文本 + 图片输入;文本输出
语言 100+
协议 Apache 2.0(权重、量化、草稿模型、编码器)
硬件 4-bit 量化 24GB/32GB;全精度 BF16 需 55GB+

评测亮点

  • BionicBench(LM Studio 独立评测):任务完成率 83.3%,Gemma 4 31B 与 Qwen3.6-27B 均为 77.7%。
  • 智能体领先项:在 MCP Atlas、DeepSearch QA、SWE-Bench Pro 上领先对标模型。
  • 权衡:在多小时长会话的 OSWorld-Verified、TerminalBench 2.1、SkillsBench 上落后于 Qwen3.6-27B。

适用场景

  • 私有本地编程智能体:完全离线运行工具调用智能体,数据不出本机。
  • 文档与屏幕理解:智能体边读截图、图表、文档边调用工具。
  • 个人助手:Claw/Hermes 式部署,需要长程上下文与多模态感知。
  • 成本敏感管线:LLM 作为裁判与重复评测类工作负载,本地运行成本极低。

优势

  1. 真正本地智能体:30B 多模态智能体适配单张消费级 GPU,协议完全宽松。
  2. 一体化技术栈:量化、投机解码、运行时协同设计,而非事后拼装。
  3. Meta 生态:官方 GGUF、ExecuTorch、transformers 支持,并有 AMD、Arm、Dell、Intel、NVIDIA 硬件合作伙伴。

使用技巧

  1. 24GB 卡先用 K-Quant-17GB:先验证纯文本性能,再逐步加入视觉与 DFlash,同时留意显存余量。
  2. 智能体循环里启用 DFlash:投机解码对长推理链与多步工具调用收益最大。
  3. 数小时终端会话选 Qwen3.6-27B:Glimmer 擅长范围明确的工具使用,超长自主运行上竞品领先。

总结

Muse Glimmer 为本地智能体开发者提供了第一个现实的默认选择:协议宽松、多模态、智能体原生的 30B 模型,能跑在已有硬件上。如果你想要不依赖云的私有常驻编码与工具调用智能体,它是当前同类中最强的开源选项。

评论

还没有评论。成为第一个评论的人!