oMLX logo

oMLX

打开

oMLX 是 Apache-2.0 的 Apple Silicon 推理服务器,带 SSD KV 缓存和 macOS 菜单栏应用,给编程智能体用。

分享:
查看替代方案

oMLX 是跑在 Apple Silicon 上的 macOS 原生 MLX 推理服务器。产品站是 omlx.ai。仓库 jundot/omlxApache-2.0,创建于 2026-02-13,语言 Python。2026-09-12 GitHub 显示 21,647 star1,859 fork,最近推送 2026-09-11。当天查到的最新 Release 是 v0.6.4(发布于 2026-08-29)。Reddit 首页推荐流和 r/oMLX 社区把它和本地跑 Qwen3.8-Flash-Next 放在一起。

对照 mlx-serve 若你要无 Python 的 Zig 二进制,对照 Ollama 若你要跨系统再加云端席位,对照 Claude Code 若你只要能指向 localhost 的智能体。

核心功能

  • 分页 SSD KV 缓存:缓存块以 safetensors 落盘。热块留 RAM,冷块按 LRU 进 SSD。前缀可跨请求、跨重启恢复,不必重算。
  • 连续批处理:mlx-lm BatchGenerator。官网在 M3 Ultra 512 GB、Qwen3-Coder-Next 8bit、pp1024/tg128、无缓存复用下的表:1x 58.7 tok/s,8x 243.3 tok/s4.14x)。
  • 原生菜单栏应用:已签名公证,应用内自动更新,不是 Electron。Web 仪表盘管模型、聊天和指标。Homebrew tap jundot/omlx
  • OpenAI + Anthropic 兼容http://localhost:8000 上的 /v1/chat/completions/v1/messages。仪表盘会生成给 Claude Code、Cursor、OpenClaw、OpenCode、Codex 的配置命令。
  • 共用模型目录:读 ~/.cache/huggingface/hub、LM Studio 目录和自定义路径。LLM、VLM、embedding、reranker 可同时加载。

限制:21,647 star 是热度,不是审计。速度表是第一方在 M3 Ultra 512 GB 上的数字,不是第三方评测。需要 macOS 15+ 和 Apple Silicon。官网写最低 16 GB 内存,建议 64 GB+。源码安装要 Python 3.11–3.13。GLM-5.2 / MiniMax 融合核需要完整 Xcode 或官方 DMG;普通 pip install 会静默回退。

适用场景

  • 在 Mac 上跑 Claude Code / Cursor / OpenClaw,会话里 KV 缓存反复失效,Ollama / LM Studio 要重算 30–90 秒 prompt。
  • 手里已有 Hugging Face 或 LM Studio 权重,不想再下一遍。
  • 更该用 mlx-serve 的人:要 Zig 二进制、11234 端口上的 Anthropic 方言、不要 Python。

定价

部分 价格 2026-09-12 第一方页面
oMLX 应用、CLI、服务器 $0 Apache-2.0。约 21,647 star。DMG 在 GitHub Releases。
机器 你的 Mac Apple Silicon,macOS 15+。无云端推理费。

快速开始

  1. github.com/jundot/omlx/releases 下载 DMG 拖进应用程序,或 brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx
  2. 打开应用。欢迎页设置模型目录、启动服务器,并可下载第一个模型。
  3. 把 Claude Code 或 Cursor 指到 http://localhost:8000。仪表盘会打印完整 export 命令。
  4. 可选 CLI:omlx serve --model-dir ~/models

第一方资料:READMEomlx.ai

常见问题

和 mlx-serve 是同一个东西吗?

不是。mlx-serve 是 Zig 服务,端口 11234,内嵌 llama.cpp。oMLX 是 Python/MLX,端口 8000,带 SSD 分层 KV 缓存和菜单栏应用。

要重新下载模型吗?

不用。它读标准 Hugging Face hub 缓存和 LM Studio 目录。

需要 GPU 服务器吗?

不需要。只支持 Apple Silicon。不是 Windows、不是 Linux、不是 Intel Mac。

替代方案

  • mlx-serve:Zig,无 Python,GGUF 加 MLX。
  • Ollama:跨系统本地运行器。
  • Claude Code:指向这台 localhost 的智能体。

使用技巧

  1. 若要跑 GLM-5.2 或 MiniMax,优先用已签名 DMG,自定义核已预编译。
  2. 官网 FAQ 把 64 GB+ 内存当作日常编程舒适线。
  3. 第二轮起,官网声称前缀命中 SSD 缓存时 TTFT 低于 5 秒。第一轮仍要付预填充成本。

总结

编程智能体把内存里的 KV 缓存打爆时,oMLX 是值得先试的 Mac 本地服务器。从 omlx.ai 开始,若你不要 Python,把 mlx-serve 留在短名单。

评论

还没有评论。成为第一个评论的人!