halogen-flash-server(halogen)は、1 つの GPU と 1 つのモデル族向けの推論サーバです。AMD Strix Halo(gfx1151)と Qwen3.8-Flash-Next。リポジトリ peonist-ai/halogen-flash-server の作成日は 2026-08-26。2026-09-20 の GitHub は 582 stars、33 forks。582 stars は熱量の信号であり、トラフィックではありません。GitHub SPDX は Other。再配布の前に LICENSE.md を読んでください。重みは Hugging Face。2026-09-20 の README クイックスタートが引用するイメージタグは 0.12.0。r/LocalLLaMA ではこの構成で Strix Halo の 1M コンテキストが話題になりました。
汎用の vLLM や llama.cpp の置き換えではありません。Apple Silicon なら mlx-serve、NVIDIA 消費者向け GPU なら ExLlamaV3、複数 OS のランナーなら Ollama。
主な機能
- 1 シリコンのカーネル: README の主張は、すべてのカーネルがこの GPU とこのモデル族向けであり、移植用フォールバックはない、ということです。他 GPU で起動しない理由でもあります。
- OpenAI 互換
/v1: Chat Completions と Responses、ツール呼び出し、Codex CLI のwire_api = "responses"、構造化 JSON schema。HALOGEN_VISION_TOWERを立てると画像も。 - 貪欲一致付き投機: temperature 0 では出力が直列貪欲とバイト一致。0.6.0 以降は draft head と prompt lookup。
- 手元の GGUF(0.7.0 以降): 同じカーネルでこのモデルの llama.cpp GGUF を開く(README は unsloth
UD-IQ4_XSを名指し)。 - エージェントハーネス: Pi、OpenCode、Codex CLI、hermes-agent、Cline、Roo Code、aider はカスタム OpenAI サーバへ思考制御をほとんど送りません。実際に走るのはサーバ既定です。
制約: 初回起動は約 118 GiB を取ります。README は 128 GB 統合メモリのマシンを独占させたい、と書きます。free は過大です。ロックした重みが回収可能なキャッシュに見えるためです。GPU が違えば起動しません。文中の 4 倍エンドツーエンド表を移植可能なベンチにしないでください。それらの行は、約 85 W、IOMMU オフという条件での作者測定です。
使用シナリオ
- Strix Halo 機(Ryzen AI Max+ 395 級)で、Codex などのハーネスに Flash-Next をローカル提供したい。
- このモデルの GGUF を既に持ち、汎用ランタイムではなくこのエンジンを使いたい。
- 避ける: NVIDIA、Apple Silicon、gfx1151 以外。
料金プラン
| 部分 | 価格 | 2026-09-20 の第一者ページ |
|---|---|---|
| サーバイメージ | 公開コンテナの実行は $0 | GitHub SPDX Other。約 582 stars。README のタグ 0.12.0。 |
| 重み | ダウンロード費用 | peonist-ai/halogen-qwen3.8-flash-next、初回約 118 GiB。 |
| ハードウェア | あなたの Strix Halo | README の参照ホストは 128 GB 統合メモリ。 |
はじめに
- gfx1151 上で Podman(Docker では
keep-groupsの代わりに--group-add video --group-add render):
podman run --rm -p 8731:8731 \
--device /dev/kfd --device /dev/dri --group-add keep-groups \
--ipc=host --ulimit memlock=-1:-1 \
-e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
-v ~/halogen-models:/models \
ghcr.io/peonist-ai/halogen-flash-server:0.12.0
- クライアントを
http://<host>:8731/v1へ。モデル名はhalogen-qwen3.8-flash-next。 - 実行中ビルドの能力は
/healthを読む。
第一者の入口: README。
よくある質問
5090 や M5 で動く?
動きません。README は「このシリコンだけ」と明示します。
返信が空なのは?
思考トークンも max_tokens に入ります。0.11.0 以降は answer room が返答用の残りを残します。まず finish_reason。"length" は予算切れです。
4 倍は監査済み?
作者が公表済みの EngramHalo.cpp、ROCmFP4、CIRU-IU4 の数字と並べた表で、電力と IOMMU 条件が書いてあります。引用する前に自分の箱で再現してください。
代替案
- mlx-serve: Apple Silicon での Flash-Next 経路。
- ExLlamaV3: NVIDIA 消費者向け GPU。
- Qwen3.8-Flash-Next: このエンジンに縛られない重み。
ヒント
- ホストを独占させる。別の重いプロセスとメモリを奪い合うと、README のハングが出ます。
- ハーネスがサンプリングを送らないなら既定を自分で置く。モデルカードの思考設定は temperature 1.0、topp 0.95、topk 20。
MemAvailableではなく、起動行の host memory left を信じる。
まとめ
halogen-flash-server は Strix Halo 上の Qwen3.8-Flash-Next 専用であり、汎用ローカル LLM ランタイムではありません。その GPU なら使ってください。違うなら mlx-serve か ExLlamaV3 です。
コメント
まだコメントがありません。最初のコメントを投稿してください!