mlx-serve 是面向 Apple Silicon 的原生 Zig 推理服务。产品站是 mlxserve.com。仓库 ddalcu/mlx-serve 是 MIT,创建于 2026-02-17。2026-09-10 GitHub 显示 1,209 star、109 fork。r/LocalLLaMA 把它当成 Mac 上跑 Qwen3.8-Flash-Next 长上下文的路径。当天核对的最新 GitHub 发行是 v26.9.2(2026-09-09 发布),说明 Flash Next 的推测解码更快。作者是 David Dalcu。没有 Python 运行时。
对照 Ollama 若你要跨系统的本地运行器加云端席位,对照 NInfer 若你有一张 RTX 5090,对照 Claude Code 若你只要能指向 localhost 的编程智能体。
核心功能
- 一个二进制里的 MLX 和 GGUF:官网和 README 写明 Gemma、Qwen、Llama、Mistral 等走原生 MLX,任意
.gguf走内嵌 llama.cpp。96 GB 以上的 Mac 跑 DeepSeek V4 Flash 走内嵌 antirez/ds4 引擎。 http://localhost:11234上的三种 API:OpenAI chat completions 与 Responses、Anthropic Messages(Claude Code 可设ANTHROPIC_BASE_URL),以及 Ollama 的/api/chat一族,现有 Ollama 客户端只需改端口。- MLX Core.app:已签名公证的菜单栏应用,含对话、智能体模式、MCP 工具、模型浏览器和媒体页(图、视频、音乐、语音、3D)。Homebrew:
brew install --cask mlx-core,或只要 CLI 则brew install mlx-serve。 - 需要 macOS 26.2+ 的 Apple Silicon:README 写得很清楚。不是 Windows、不是 Linux、不是 Intel Mac。
边界:1,209 star 是热度,不是审计。官网相对 LM Studio 的速度数字是 M4 Max 上的第一方基准,不是第三方测评。iPhone 配套 MLX Chat 需要较新的 A17 Pro 级设备和 iOS 26+。
适用场景
- Apple Silicon 用户,想让 Claude Code、Cursor 或 Open WebUI 跑本地权重、不配云端密钥。
- 已经在 Mac 上用 Ollama 的人,可以把地址改成
http://localhost:11234,Raycast 或 Obsidian 插件继续用。 - 机器不是 M 系列 Mac 的人,应改看 Ollama 或 NInfer。
定价方案
| 部分 | 价格 | 2026-09-10 第一方页面 |
|---|---|---|
| mlx-serve / MLX Core | $0 | MIT。约 1,209 star。FAQ:无订阅、无账号。 |
| 硬件 | 你的 Mac | macOS 26.2+ Apple Silicon。DeepSeek V4 Flash 要 96 GB+。 |
| iPhone 应用 | 以 App Store 为准 | 同一引擎,独立上架。 |
快速开始
- 下载 MLXCore.dmg,或
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve && brew install --cask mlx-core。 - 在应用里下载适合这台 Mac 的推荐模型,或在终端跑
mlx-serve run gemma4。 - Claude Code 设置
export ANTHROPIC_BASE_URL=http://localhost:11234,或把任意 OpenAI 客户端指到同一主机。 - 若 r/LocalLLaMA 跑的是该检查点,再确认 Qwen3.8-Flash-Next。
第一方资源:mlxserve.com 和 README。
常见问题
能在 Mac 上替代 Ollama 吗?
在 Apple Silicon 上,官网写它原生讲 Ollama 的 HTTP。其他操作系统仍要用 Ollama。
能在 5090 PC 上跑吗?
不能。那是 NInfer 的赛道。mlx-serve 只做 macOS Apple Silicon。
必须装 LM Studio 吗?
不必。README 把它定位成本地服务器加原生应用,不是 Electron 宿主。
替代方案
- Ollama:本地运行器加可选云端,覆盖主流系统。
- NInfer:只服务 RTX 5090 的 Qwen 引擎。
- Claude Code:mlx-serve 可以在本地托管的智能体。
- Qwen3.8-Flash-Next:r/LocalLLaMA 在它上面跑的长上下文检查点。
使用技巧
- 引用 2026-09-10 核对过的 MIT、1,209 star、v26.9.2、macOS 26.2+ 和端口 11234。
- 不要宣传 Windows 或 CUDA。
- 默认绑在
127.0.0.1。局域网再用时先设 API key。
总结
mlx-serve 是 r/LocalLLaMA 用来跑 Flash Next 的 MIT Apple Silicon 服务:MLX 加 GGUF,OpenAI 和 Anthropic 接口,没有 Python。从 mlxserve.com 开始。若运行器不能是 Mac,打开 Ollama 即可。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。
7 款 AI 编程 CLI 用了半年,我悟出一个道理:模型再强,干活也要有监督
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness 各有性格。半年深度使用后我总结出一套分工矩阵:pi 做最省事的 CR、omp 审复杂 PR、DeepSeek Harness 配 V4 Flash 高频低成本审查、Claude Code 与 Qoder 写代码。模型再强,干活也要有监督,而且最好是独立第三方。

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。