mlx-serve は Apple Silicon 向けのネイティブ Zig 推論サーバです。製品サイトは mlxserve.com。リポジトリ ddalcu/mlx-serve は MIT、作成日 2026-02-17。2026-09-10 の GitHub は 1,209 stars、109 forks。r/LocalLLaMA は Qwen3.8-Flash-Next を長いコンテキストで Mac 上に載せる経路として投稿しました。同日確認した最新リリースは v26.9.2(2026-09-09 公開)で、Flash Next の投機的デコードが速いと書いています。作者は David Dalcu。Python ランタイムはありません。
マルチ OS のローカルランナーとクラウド席が必要なら Ollama、RTX 5090 が 1 枚あるなら NInfer、localhost を向ければよいコーディングエージェントだけなら Claude Code を見てください。
主な機能
- 1 バイナリに MLX と GGUF:サイトと README は Gemma、Qwen、Llama、Mistral などをネイティブ MLX、任意の
.ggufを埋め込み llama.cpp と書いています。96 GB 以上の Mac での DeepSeek V4 Flash は埋め込み antirez/ds4 エンジンです。 http://localhost:11234の 3 方言:OpenAI の chat completions と Responses、Anthropic Messages(Claude Code はANTHROPIC_BASE_URL)、Ollama の/api/chat系。既存の Ollama クライアントはポート以外を変えずに済みます。- MLX Core.app:署名・公証済みメニューバーアプリ。チャット、エージェント、MCP、モデルブラウザ、メディア(画像、動画、音楽、音声、3D)。Homebrew は
brew install --cask mlx-core、CLI だけならbrew install mlx-serve。 - macOS 26.2+ の Apple Silicon が必要:README が明示。Windows でも Linux でも Intel Mac でもありません。
限界:1,209 stars は熱量であり監査ではありません。LM Studio との速度比較は M4 Max 上の一次ベンチであり、第三者検証ではありません。iPhone 向け MLX Chat は新しい A17 Pro 級と iOS 26+ が必要です。
使用シナリオ
- クラウドキーなしで Claude Code、Cursor、Open WebUI をローカル重みに載せたい Apple Silicon ユーザー。
- Mac で Ollama を使っている人。
http://localhost:11234に付け替え、Raycast や Obsidian プラグインを続ける。 - M シリーズ Mac ではない人。代わりに Ollama か NInfer。
料金プラン
| 部分 | 価格 | 2026-09-10 の一次情報 |
|---|---|---|
| mlx-serve / MLX Core | $0 | MIT。約 1,209 stars。FAQ:購読なし、アカウントなし。 |
| ハードウェア | 自分の Mac | macOS 26.2+ Apple Silicon。DeepSeek V4 Flash は 96 GB+。 |
| iPhone アプリ | App Store を確認 | 同じエンジン、別掲載。 |
はじめに
- MLXCore.dmg をダウンロードするか、
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve && brew install --cask mlx-core。 - アプリで Mac に合う推奨モデルを取るか、端末で
mlx-serve run gemma4。 - Claude Code は
export ANTHROPIC_BASE_URL=http://localhost:11234。OpenAI クライアントも同じホストへ。 - r/LocalLLaMA がそのチェックポイントなら Qwen3.8-Flash-Next を確認。
一次情報:mlxserve.com と README。
よくある質問
Mac で Ollama の代わりになりますか?
Apple Silicon では、サイトは Ollama の HTTP をネイティブに話すと書いています。他 OS は今も Ollama です。
5090 PC で動きますか?
動きません。それは NInfer の領域です。mlx-serve は macOS Apple Silicon です。
LM Studio は必須ですか?
必須ではありません。README は Electron ホストではなく、ローカルサーバとネイティブアプリとして位置づけています。
代替案
- Ollama:ローカルランナーと任意クラウド。主要 OS。
- NInfer:RTX 5090 専用の Qwen エンジン。
- Claude Code:mlx-serve がローカルでホストできるエージェント。
- Qwen3.8-Flash-Next:r/LocalLLaMA が載せていた長いコンテキストのチェックポイント。
ヒント
- 2026-09-10 に確認した MIT、1,209 stars、v26.9.2、macOS 26.2+、ポート 11234 を引用する。
- Windows や CUDA を宣伝しない。
- 既定は
127.0.0.1。LAN 公開時は先に API キーを付ける。
まとめ
mlx-serve は r/LocalLLaMA が Flash Next に使っていた MIT の Apple Silicon サーバです。MLX と GGUF、OpenAI と Anthropic、Python なし。mlxserve.com から始めてください。ランナーが Mac であってはならないなら Ollama を開いてください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
Skills + Hooks + Plugins:AnthropicによるAIコーディングツールの拡張性の再定義
Claude CodeのSkills、Hooks、Pluginsという三位一体アーキテクチャを深く分析し、なぜこの設計がGitHub CopilotやCursorよりも先進的なのか、そしてオープンスタンダードを通じてAIコーディングツールの拡張性をどのように再定義しているかを探ります。