halogen-flash-server logo

halogen-flash-server

開く

halogen-flash-server は Strix Halo 向け推論サーバで、OpenAI 互換 API で Qwen3.8-Flash-Next を動かす。

共有:
代替ツールを見る

halogen-flash-server(halogen)は、1 つの GPU と 1 つのモデル族向けの推論サーバです。AMD Strix Halo(gfx1151)と Qwen3.8-Flash-Next。リポジトリ peonist-ai/halogen-flash-server の作成日は 2026-08-26。2026-09-20 の GitHub は 582 stars33 forks。582 stars は熱量の信号であり、トラフィックではありません。GitHub SPDX は Other。再配布の前に LICENSE.md を読んでください。重みは Hugging Face。2026-09-20 の README クイックスタートが引用するイメージタグは 0.12.0。r/LocalLLaMA ではこの構成で Strix Halo の 1M コンテキストが話題になりました。

汎用の vLLM や llama.cpp の置き換えではありません。Apple Silicon なら mlx-serve、NVIDIA 消費者向け GPU なら ExLlamaV3、複数 OS のランナーなら Ollama

主な機能

  • 1 シリコンのカーネル: README の主張は、すべてのカーネルがこの GPU とこのモデル族向けであり、移植用フォールバックはない、ということです。他 GPU で起動しない理由でもあります。
  • OpenAI 互換 /v1: Chat Completions と Responses、ツール呼び出し、Codex CLI の wire_api = "responses"、構造化 JSON schema。HALOGEN_VISION_TOWER を立てると画像も。
  • 貪欲一致付き投機: temperature 0 では出力が直列貪欲とバイト一致。0.6.0 以降は draft head と prompt lookup。
  • 手元の GGUF(0.7.0 以降): 同じカーネルでこのモデルの llama.cpp GGUF を開く(README は unsloth UD-IQ4_XS を名指し)。
  • エージェントハーネス: Pi、OpenCode、Codex CLI、hermes-agent、Cline、Roo Code、aider はカスタム OpenAI サーバへ思考制御をほとんど送りません。実際に走るのはサーバ既定です。

制約: 初回起動は約 118 GiB を取ります。README は 128 GB 統合メモリのマシンを独占させたい、と書きます。free は過大です。ロックした重みが回収可能なキャッシュに見えるためです。GPU が違えば起動しません。文中の 4 倍エンドツーエンド表を移植可能なベンチにしないでください。それらの行は、約 85 W、IOMMU オフという条件での作者測定です。

使用シナリオ

  • Strix Halo 機(Ryzen AI Max+ 395 級)で、Codex などのハーネスに Flash-Next をローカル提供したい。
  • このモデルの GGUF を既に持ち、汎用ランタイムではなくこのエンジンを使いたい。
  • 避ける: NVIDIA、Apple Silicon、gfx1151 以外。

料金プラン

部分 価格 2026-09-20 の第一者ページ
サーバイメージ 公開コンテナの実行は $0 GitHub SPDX Other。約 582 stars。README のタグ 0.12.0。
重み ダウンロード費用 peonist-ai/halogen-qwen3.8-flash-next、初回約 118 GiB。
ハードウェア あなたの Strix Halo README の参照ホストは 128 GB 統合メモリ。

はじめに

  1. gfx1151 上で Podman(Docker では keep-groups の代わりに --group-add video --group-add render):
podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
  -v ~/halogen-models:/models \
  ghcr.io/peonist-ai/halogen-flash-server:0.12.0
  1. クライアントを http://<host>:8731/v1 へ。モデル名は halogen-qwen3.8-flash-next
  2. 実行中ビルドの能力は /health を読む。

第一者の入口: README

よくある質問

5090 や M5 で動く?

動きません。README は「このシリコンだけ」と明示します。

返信が空なのは?

思考トークンも max_tokens に入ります。0.11.0 以降は answer room が返答用の残りを残します。まず finish_reason"length" は予算切れです。

4 倍は監査済み?

作者が公表済みの EngramHalo.cpp、ROCmFP4、CIRU-IU4 の数字と並べた表で、電力と IOMMU 条件が書いてあります。引用する前に自分の箱で再現してください。

代替案

ヒント

  1. ホストを独占させる。別の重いプロセスとメモリを奪い合うと、README のハングが出ます。
  2. ハーネスがサンプリングを送らないなら既定を自分で置く。モデルカードの思考設定は temperature 1.0、topp 0.95、topk 20。
  3. MemAvailable ではなく、起動行の host memory left を信じる。

まとめ

halogen-flash-server は Strix Halo 上の Qwen3.8-Flash-Next 専用であり、汎用ローカル LLM ランタイムではありません。その GPU なら使ってください。違うなら mlx-serve か ExLlamaV3 です。

コメント

まだコメントがありません。最初のコメントを投稿してください!