oMLX は Apple Silicon 向けの macOS ネイティブ MLX 推論サーバです。製品サイトは omlx.ai。リポジトリ jundot/omlx は Apache-2.0、作成 2026-02-13、言語 Python。2026-09-12 時点の GitHub は 21,647 stars、1,859 forks、最終 push 2026-09-11。同日確認の最新リリースは v0.6.4(公開 2026-08-29)。Reddit ホームフィードと r/oMLX は、ローカルの Qwen3.8-Flash-Next と並べて紹介していました。
Zig バイナリで Python なしなら mlx-serve、マルチ OS とクラウド席が要るなら Ollama、localhost を向けるエージェントだけなら Claude Code を見てください。
主な機能
- ページド SSD KV キャッシュ:ブロックを safetensors でディスクへ。ホットは RAM、コールドは LRU で SSD。プレフィックスはリクエストと再起動をまたいで復元し、再計算しない。
- 連続バッチ:mlx-lm の
BatchGenerator。公式表は M3 Ultra 512 GB、Qwen3-Coder-Next 8bit、pp1024/tg128、キャッシュ再利用なしで 1x 58.7 tok/s、8x 243.3 tok/s(4.14x)。 - ネイティブメニューバーアプリ:署名・公証済み、アプリ内自動更新、Electron ではない。Web ダッシュボードでモデル、チャット、メトリクス。Homebrew tap は
jundot/omlx。 - OpenAI + Anthropic 互換:
http://localhost:8000の/v1/chat/completionsと/v1/messages。ダッシュボードが Claude Code、Cursor、OpenClaw、OpenCode、Codex 用の設定コマンドを出す。 - 共有モデルディレクトリ:
~/.cache/huggingface/hub、LM Studio フォルダ、カスタムパスを読む。LLM、VLM、embedding、reranker を同時ロードできる。
制約: 21,647 stars は熱量であり監査ではない。速度表は M3 Ultra 512 GB の第一者ベンチで、第三者評価ではない。macOS 15+ と Apple Silicon が必要。サイトは RAM 16 GB が最低、64 GB+ を推奨。ソースインストールは Python 3.11–3.13。GLM-5.2 / MiniMax の融合カーネルはフル Xcode か公式 DMG が必要で、素の pip install は静かにフォールバックする。
使用シナリオ
- Mac 上の Claude Code / Cursor / OpenClaw で、セッション中に KV キャッシュが何度も無効化され、Ollama / LM Studio が 30–90 秒のプロンプトを再計算するとき。
- Hugging Face や LM Studio の重みを既に持っていて、二度ダウンロードしたくない人。
- 代わりに mlx-serve を使うべき人:Zig バイナリ、ポート 11234 の Anthropic 方言、Python なし。
料金
| 部分 | 価格 | 2026-09-12 の第一者ページ |
|---|---|---|
| oMLX アプリ、CLI、サーバ | $0 | Apache-2.0。約 21,647 stars。DMG は GitHub Releases。 |
| マシン | 自分の Mac | Apple Silicon、macOS 15+。クラウド推論料金なし。 |
はじめに
- github.com/jundot/omlx/releases から DMG を Applications へ、または
brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx。 - アプリを起動。ウェルカム画面でモデルディレクトリ、サーバ起動、最初のモデル取得。
- Claude Code や Cursor を
http://localhost:8000に向ける。ダッシュボードが export コマンドを出す。 - 任意 CLI:
omlx serve --model-dir ~/models。
よくある質問
mlx-serve と同じですか?
違います。mlx-serve は Zig サーバ、ポート 11234、llama.cpp 内蔵。oMLX は Python/MLX、ポート 8000、SSD 階層 KV キャッシュとメニューバーアプリです。
モデルを再ダウンロードしますか?
しません。標準の Hugging Face hub キャッシュと LM Studio フォルダを読みます。
GPU サーバは必要ですか?
不要。Apple Silicon のみ。Windows、Linux、Intel Mac は対象外。
代替案
- mlx-serve:Zig、Python なし、GGUF と MLX。
- Ollama:マルチ OS のローカルランナー。
- Claude Code:この localhost を向けるエージェント。
ヒント
- GLM-5.2 や MiniMax を出すなら署名済み DMG を優先。カスタムカーネルがプリコンパイルされている。
- サイト FAQ は日常コーディングの快適ラインを 64 GB+ RAM としている。
- 2 ターン目以降、プレフィックスが SSD キャッシュに当たれば TTFT 5 秒未満がサイトの主張。初回はプリフィル代を払う。
まとめ
コーディングエージェントがメモリ内 KV キャッシュを壊し続けるなら、まず oMLX を試す。omlx.ai から始め、Python なしが欲しいなら mlx-serve をショートリストに残す。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト
7 つの AI コーディング CLI を半年使って悟ったこと:モデルがどんなに強くても、仕事には監督が必要
Claude Code、Codex、opencode、pi、omp、DeepSeek Harness はそれぞれ性格が違う。半年間の深い使用で確立した分業:pi で最速最省のレビュー、omp で複雑な PR レビュー、DeepSeek Harness + V4 Flash で高頻度・低コストなレビュー、Claude Code と Qoder でコーディング。モデルがどんなに強くても、仕事には監督が必要——しかも独立した第三者であるべき。

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
Skills + Hooks + Plugins:AnthropicによるAIコーディングツールの拡張性の再定義
Claude CodeのSkills、Hooks、Pluginsという三位一体アーキテクチャを深く分析し、なぜこの設計がGitHub CopilotやCursorよりも先進的なのか、そしてオープンスタンダードを通じてAIコーディングツールの拡張性をどのように再定義しているかを探ります。