mlx-serve logo

mlx-serve

打开

mlx-serve 是 MIT 的 Zig 推理服务,在 Apple Silicon 上本地跑 MLX 与 GGUF,提供 OpenAI 和 Anthropic API,不用 Python。

分享:
查看替代方案

mlx-serve 是面向 Apple Silicon 的原生 Zig 推理服务。产品站是 mlxserve.com。仓库 ddalcu/mlx-serveMIT,创建于 2026-02-17。2026-09-10 GitHub 显示 1,209 star109 fork。r/LocalLLaMA 把它当成 Mac 上跑 Qwen3.8-Flash-Next 长上下文的路径。当天核对的最新 GitHub 发行是 v26.9.2(2026-09-09 发布),说明 Flash Next 的推测解码更快。作者是 David Dalcu。没有 Python 运行时。

对照 Ollama 若你要跨系统的本地运行器加云端席位,对照 NInfer 若你有一张 RTX 5090,对照 Claude Code 若你只要能指向 localhost 的编程智能体。

核心功能

  • 一个二进制里的 MLX 和 GGUF:官网和 README 写明 Gemma、Qwen、Llama、Mistral 等走原生 MLX,任意 .gguf 走内嵌 llama.cpp。96 GB 以上的 Mac 跑 DeepSeek V4 Flash 走内嵌 antirez/ds4 引擎。
  • http://localhost:11234 上的三种 API:OpenAI chat completions 与 Responses、Anthropic Messages(Claude Code 可设 ANTHROPIC_BASE_URL),以及 Ollama 的 /api/chat 一族,现有 Ollama 客户端只需改端口。
  • MLX Core.app:已签名公证的菜单栏应用,含对话、智能体模式、MCP 工具、模型浏览器和媒体页(图、视频、音乐、语音、3D)。Homebrew:brew install --cask mlx-core,或只要 CLI 则 brew install mlx-serve
  • 需要 macOS 26.2+ 的 Apple Silicon:README 写得很清楚。不是 Windows、不是 Linux、不是 Intel Mac。

边界:1,209 star 是热度,不是审计。官网相对 LM Studio 的速度数字是 M4 Max 上的第一方基准,不是第三方测评。iPhone 配套 MLX Chat 需要较新的 A17 Pro 级设备和 iOS 26+。

适用场景

  • Apple Silicon 用户,想让 Claude Code、Cursor 或 Open WebUI 跑本地权重、不配云端密钥。
  • 已经在 Mac 上用 Ollama 的人,可以把地址改成 http://localhost:11234,Raycast 或 Obsidian 插件继续用。
  • 机器不是 M 系列 Mac 的人,应改看 OllamaNInfer

定价方案

部分 价格 2026-09-10 第一方页面
mlx-serve / MLX Core $0 MIT。约 1,209 star。FAQ:无订阅、无账号。
硬件 你的 Mac macOS 26.2+ Apple Silicon。DeepSeek V4 Flash 要 96 GB+。
iPhone 应用 以 App Store 为准 同一引擎,独立上架。

快速开始

  1. 下载 MLXCore.dmg,或 brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve && brew install --cask mlx-core
  2. 在应用里下载适合这台 Mac 的推荐模型,或在终端跑 mlx-serve run gemma4
  3. Claude Code 设置 export ANTHROPIC_BASE_URL=http://localhost:11234,或把任意 OpenAI 客户端指到同一主机。
  4. 若 r/LocalLLaMA 跑的是该检查点,再确认 Qwen3.8-Flash-Next

第一方资源:mlxserve.comREADME

常见问题

能在 Mac 上替代 Ollama 吗?

在 Apple Silicon 上,官网写它原生讲 Ollama 的 HTTP。其他操作系统仍要用 Ollama

能在 5090 PC 上跑吗?

不能。那是 NInfer 的赛道。mlx-serve 只做 macOS Apple Silicon。

必须装 LM Studio 吗?

不必。README 把它定位成本地服务器加原生应用,不是 Electron 宿主。

替代方案

  • Ollama:本地运行器加可选云端,覆盖主流系统。
  • NInfer:只服务 RTX 5090 的 Qwen 引擎。
  • Claude Code:mlx-serve 可以在本地托管的智能体。
  • Qwen3.8-Flash-Next:r/LocalLLaMA 在它上面跑的长上下文检查点。

使用技巧

  1. 引用 2026-09-10 核对过的 MIT、1,209 star、v26.9.2、macOS 26.2+ 和端口 11234。
  2. 不要宣传 Windows 或 CUDA。
  3. 默认绑在 127.0.0.1。局域网再用时先设 API key。

总结

mlx-serve 是 r/LocalLLaMA 用来跑 Flash Next 的 MIT Apple Silicon 服务:MLX 加 GGUF,OpenAI 和 Anthropic 接口,没有 Python。从 mlxserve.com 开始。若运行器不能是 Mac,打开 Ollama 即可。

评论

还没有评论。成为第一个评论的人!