oMLX logo

oMLX

開く

oMLX は Apache-2.0 の Apple Silicon 推論サーバで、SSD KV キャッシュと macOS メニューバーアプリをコーディングエージェント向けに提供します。

共有:
代替ツールを見る

oMLX は Apple Silicon 向けの macOS ネイティブ MLX 推論サーバです。製品サイトは omlx.ai。リポジトリ jundot/omlxApache-2.0、作成 2026-02-13、言語 Python。2026-09-12 時点の GitHub は 21,647 stars1,859 forks、最終 push 2026-09-11。同日確認の最新リリースは v0.6.4(公開 2026-08-29)。Reddit ホームフィードと r/oMLX は、ローカルの Qwen3.8-Flash-Next と並べて紹介していました。

Zig バイナリで Python なしなら mlx-serve、マルチ OS とクラウド席が要るなら Ollama、localhost を向けるエージェントだけなら Claude Code を見てください。

主な機能

  • ページド SSD KV キャッシュ:ブロックを safetensors でディスクへ。ホットは RAM、コールドは LRU で SSD。プレフィックスはリクエストと再起動をまたいで復元し、再計算しない。
  • 連続バッチ:mlx-lm の BatchGenerator。公式表は M3 Ultra 512 GB、Qwen3-Coder-Next 8bit、pp1024/tg128、キャッシュ再利用なしで 1x 58.7 tok/s、8x 243.3 tok/s4.14x)。
  • ネイティブメニューバーアプリ:署名・公証済み、アプリ内自動更新、Electron ではない。Web ダッシュボードでモデル、チャット、メトリクス。Homebrew tap は jundot/omlx
  • OpenAI + Anthropic 互換http://localhost:8000/v1/chat/completions/v1/messages。ダッシュボードが Claude Code、Cursor、OpenClaw、OpenCode、Codex 用の設定コマンドを出す。
  • 共有モデルディレクトリ~/.cache/huggingface/hub、LM Studio フォルダ、カスタムパスを読む。LLM、VLM、embedding、reranker を同時ロードできる。

制約: 21,647 stars は熱量であり監査ではない。速度表は M3 Ultra 512 GB の第一者ベンチで、第三者評価ではない。macOS 15+ と Apple Silicon が必要。サイトは RAM 16 GB が最低、64 GB+ を推奨。ソースインストールは Python 3.11–3.13。GLM-5.2 / MiniMax の融合カーネルはフル Xcode か公式 DMG が必要で、素の pip install は静かにフォールバックする。

使用シナリオ

  • Mac 上の Claude Code / Cursor / OpenClaw で、セッション中に KV キャッシュが何度も無効化され、Ollama / LM Studio が 30–90 秒のプロンプトを再計算するとき。
  • Hugging Face や LM Studio の重みを既に持っていて、二度ダウンロードしたくない人。
  • 代わりに mlx-serve を使うべき人:Zig バイナリ、ポート 11234 の Anthropic 方言、Python なし。

料金

部分 価格 2026-09-12 の第一者ページ
oMLX アプリ、CLI、サーバ $0 Apache-2.0。約 21,647 stars。DMG は GitHub Releases。
マシン 自分の Mac Apple Silicon、macOS 15+。クラウド推論料金なし。

はじめに

  1. github.com/jundot/omlx/releases から DMG を Applications へ、または brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx
  2. アプリを起動。ウェルカム画面でモデルディレクトリ、サーバ起動、最初のモデル取得。
  3. Claude Code や Cursor を http://localhost:8000 に向ける。ダッシュボードが export コマンドを出す。
  4. 任意 CLI:omlx serve --model-dir ~/models

第一者リソース:READMEomlx.ai

よくある質問

mlx-serve と同じですか?

違います。mlx-serve は Zig サーバ、ポート 11234、llama.cpp 内蔵。oMLX は Python/MLX、ポート 8000、SSD 階層 KV キャッシュとメニューバーアプリです。

モデルを再ダウンロードしますか?

しません。標準の Hugging Face hub キャッシュと LM Studio フォルダを読みます。

GPU サーバは必要ですか?

不要。Apple Silicon のみ。Windows、Linux、Intel Mac は対象外。

代替案

  • mlx-serve:Zig、Python なし、GGUF と MLX。
  • Ollama:マルチ OS のローカルランナー。
  • Claude Code:この localhost を向けるエージェント。

ヒント

  1. GLM-5.2 や MiniMax を出すなら署名済み DMG を優先。カスタムカーネルがプリコンパイルされている。
  2. サイト FAQ は日常コーディングの快適ラインを 64 GB+ RAM としている。
  3. 2 ターン目以降、プレフィックスが SSD キャッシュに当たれば TTFT 5 秒未満がサイトの主張。初回はプリフィル代を払う。

まとめ

コーディングエージェントがメモリ内 KV キャッシュを壊し続けるなら、まず oMLX を試す。omlx.ai から始め、Python なしが欲しいなら mlx-serve をショートリストに残す。

コメント

まだコメントがありません。最初のコメントを投稿してください!