mlx-serve logo

mlx-serve

開く

mlx-serve は Apple Silicon 向け MIT の Zig 推論サーバで、Python なしに MLX と GGUF をローカル実行し OpenAI と Anthropic API を出す。

共有:
代替ツールを見る

mlx-serve は Apple Silicon 向けのネイティブ Zig 推論サーバです。製品サイトは mlxserve.com。リポジトリ ddalcu/mlx-serveMIT、作成日 2026-02-17。2026-09-10 の GitHub は 1,209 stars109 forks。r/LocalLLaMA は Qwen3.8-Flash-Next を長いコンテキストで Mac 上に載せる経路として投稿しました。同日確認した最新リリースは v26.9.2(2026-09-09 公開)で、Flash Next の投機的デコードが速いと書いています。作者は David Dalcu。Python ランタイムはありません。

マルチ OS のローカルランナーとクラウド席が必要なら Ollama、RTX 5090 が 1 枚あるなら NInfer、localhost を向ければよいコーディングエージェントだけなら Claude Code を見てください。

主な機能

  • 1 バイナリに MLX と GGUF:サイトと README は Gemma、Qwen、Llama、Mistral などをネイティブ MLX、任意の .gguf を埋め込み llama.cpp と書いています。96 GB 以上の Mac での DeepSeek V4 Flash は埋め込み antirez/ds4 エンジンです。
  • http://localhost:11234 の 3 方言:OpenAI の chat completions と Responses、Anthropic Messages(Claude Code は ANTHROPIC_BASE_URL)、Ollama の /api/chat 系。既存の Ollama クライアントはポート以外を変えずに済みます。
  • MLX Core.app:署名・公証済みメニューバーアプリ。チャット、エージェント、MCP、モデルブラウザ、メディア(画像、動画、音楽、音声、3D)。Homebrew は brew install --cask mlx-core、CLI だけなら brew install mlx-serve
  • macOS 26.2+ の Apple Silicon が必要:README が明示。Windows でも Linux でも Intel Mac でもありません。

限界:1,209 stars は熱量であり監査ではありません。LM Studio との速度比較は M4 Max 上の一次ベンチであり、第三者検証ではありません。iPhone 向け MLX Chat は新しい A17 Pro 級と iOS 26+ が必要です。

使用シナリオ

  • クラウドキーなしで Claude Code、Cursor、Open WebUI をローカル重みに載せたい Apple Silicon ユーザー。
  • Mac で Ollama を使っている人http://localhost:11234 に付け替え、Raycast や Obsidian プラグインを続ける。
  • M シリーズ Mac ではない人。代わりに OllamaNInfer

料金プラン

部分 価格 2026-09-10 の一次情報
mlx-serve / MLX Core $0 MIT。約 1,209 stars。FAQ:購読なし、アカウントなし。
ハードウェア 自分の Mac macOS 26.2+ Apple Silicon。DeepSeek V4 Flash は 96 GB+。
iPhone アプリ App Store を確認 同じエンジン、別掲載。

はじめに

  1. MLXCore.dmg をダウンロードするか、brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve && brew install --cask mlx-core
  2. アプリで Mac に合う推奨モデルを取るか、端末で mlx-serve run gemma4
  3. Claude Code は export ANTHROPIC_BASE_URL=http://localhost:11234。OpenAI クライアントも同じホストへ。
  4. r/LocalLLaMA がそのチェックポイントなら Qwen3.8-Flash-Next を確認。

一次情報:mlxserve.comREADME

よくある質問

Mac で Ollama の代わりになりますか?

Apple Silicon では、サイトは Ollama の HTTP をネイティブに話すと書いています。他 OS は今も Ollama です。

5090 PC で動きますか?

動きません。それは NInfer の領域です。mlx-serve は macOS Apple Silicon です。

LM Studio は必須ですか?

必須ではありません。README は Electron ホストではなく、ローカルサーバとネイティブアプリとして位置づけています。

代替案

  • Ollama:ローカルランナーと任意クラウド。主要 OS。
  • NInfer:RTX 5090 専用の Qwen エンジン。
  • Claude Code:mlx-serve がローカルでホストできるエージェント。
  • Qwen3.8-Flash-Next:r/LocalLLaMA が載せていた長いコンテキストのチェックポイント。

ヒント

  1. 2026-09-10 に確認した MIT、1,209 stars、v26.9.2、macOS 26.2+、ポート 11234 を引用する。
  2. Windows や CUDA を宣伝しない。
  3. 既定は 127.0.0.1。LAN 公開時は先に API キーを付ける。

まとめ

mlx-serve は r/LocalLLaMA が Flash Next に使っていた MIT の Apple Silicon サーバです。MLX と GGUF、OpenAI と Anthropic、Python なし。mlxserve.com から始めてください。ランナーが Mac であってはならないなら Ollama を開いてください。

コメント

まだコメントがありません。最初のコメントを投稿してください!