oMLX 是跑在 Apple Silicon 上的 macOS 原生 MLX 推理服务器。产品站是 omlx.ai。仓库 jundot/omlx 为 Apache-2.0,创建于 2026-02-13,语言 Python。2026-09-12 GitHub 显示 21,647 star、1,859 fork,最近推送 2026-09-11。当天查到的最新 Release 是 v0.6.4(发布于 2026-08-29)。Reddit 首页推荐流和 r/oMLX 社区把它和本地跑 Qwen3.8-Flash-Next 放在一起。
对照 mlx-serve 若你要无 Python 的 Zig 二进制,对照 Ollama 若你要跨系统再加云端席位,对照 Claude Code 若你只要能指向 localhost 的智能体。
核心功能
- 分页 SSD KV 缓存:缓存块以 safetensors 落盘。热块留 RAM,冷块按 LRU 进 SSD。前缀可跨请求、跨重启恢复,不必重算。
- 连续批处理:mlx-lm
BatchGenerator。官网在 M3 Ultra 512 GB、Qwen3-Coder-Next 8bit、pp1024/tg128、无缓存复用下的表:1x 58.7 tok/s,8x 243.3 tok/s(4.14x)。 - 原生菜单栏应用:已签名公证,应用内自动更新,不是 Electron。Web 仪表盘管模型、聊天和指标。Homebrew tap
jundot/omlx。 - OpenAI + Anthropic 兼容:
http://localhost:8000上的/v1/chat/completions和/v1/messages。仪表盘会生成给 Claude Code、Cursor、OpenClaw、OpenCode、Codex 的配置命令。 - 共用模型目录:读
~/.cache/huggingface/hub、LM Studio 目录和自定义路径。LLM、VLM、embedding、reranker 可同时加载。
限制:21,647 star 是热度,不是审计。速度表是第一方在 M3 Ultra 512 GB 上的数字,不是第三方评测。需要 macOS 15+ 和 Apple Silicon。官网写最低 16 GB 内存,建议 64 GB+。源码安装要 Python 3.11–3.13。GLM-5.2 / MiniMax 融合核需要完整 Xcode 或官方 DMG;普通 pip install 会静默回退。
适用场景
- 在 Mac 上跑 Claude Code / Cursor / OpenClaw,会话里 KV 缓存反复失效,Ollama / LM Studio 要重算 30–90 秒 prompt。
- 手里已有 Hugging Face 或 LM Studio 权重,不想再下一遍。
- 更该用 mlx-serve 的人:要 Zig 二进制、11234 端口上的 Anthropic 方言、不要 Python。
定价
| 部分 | 价格 | 2026-09-12 第一方页面 |
|---|---|---|
| oMLX 应用、CLI、服务器 | $0 | Apache-2.0。约 21,647 star。DMG 在 GitHub Releases。 |
| 机器 | 你的 Mac | Apple Silicon,macOS 15+。无云端推理费。 |
快速开始
- 从 github.com/jundot/omlx/releases 下载 DMG 拖进应用程序,或
brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx。 - 打开应用。欢迎页设置模型目录、启动服务器,并可下载第一个模型。
- 把 Claude Code 或 Cursor 指到
http://localhost:8000。仪表盘会打印完整 export 命令。 - 可选 CLI:
omlx serve --model-dir ~/models。
常见问题
和 mlx-serve 是同一个东西吗?
不是。mlx-serve 是 Zig 服务,端口 11234,内嵌 llama.cpp。oMLX 是 Python/MLX,端口 8000,带 SSD 分层 KV 缓存和菜单栏应用。
要重新下载模型吗?
不用。它读标准 Hugging Face hub 缓存和 LM Studio 目录。
需要 GPU 服务器吗?
不需要。只支持 Apple Silicon。不是 Windows、不是 Linux、不是 Intel Mac。
替代方案
- mlx-serve:Zig,无 Python,GGUF 加 MLX。
- Ollama:跨系统本地运行器。
- Claude Code:指向这台 localhost 的智能体。
使用技巧
- 若要跑 GLM-5.2 或 MiniMax,优先用已签名 DMG,自定义核已预编译。
- 官网 FAQ 把 64 GB+ 内存当作日常编程舒适线。
- 第二轮起,官网声称前缀命中 SSD 缓存时 TTFT 低于 5 秒。第一轮仍要付预填充成本。
总结
编程智能体把内存里的 KV 缓存打爆时,oMLX 是值得先试的 Mac 本地服务器。从 omlx.ai 开始,若你不要 Python,把 mlx-serve 留在短名单。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。