halogen-flash-server(halogen)是为一块 GPU 和一个模型家族写的推理服务:AMD Strix Halo(gfx1151)和 Qwen3.8-Flash-Next。仓库 peonist-ai/halogen-flash-server 创建于 2026-08-26。2026-09-20 GitHub 显示 582 star、33 fork。582 star 是热度信号,不是访问量。GitHub SPDX 为 Other。二次分发前先读 LICENSE.md。权重在 Hugging Face。2026-09-20 README 快速开始引用的镜像标签是 0.12.0。r/LocalLLaMA 讨论过用这套在 Strix Halo 上跑 1M 上下文。
它不是通用的 vLLM 或 llama.cpp 替代。Apple Silicon 对照 mlx-serve,NVIDIA 消费级 GPU 对照 ExLlamaV3,跨系统运行器对照 Ollama。
核心功能
- 单硅内核:README 的说法是每个 kernel 只为这块 GPU 和这个模型家族服务,没有可移植回退。这也是为什么别的 GPU 起不来。
- OpenAI 兼容
/v1:Chat Completions 与 Responses、工具调用、Codex CLI 的wire_api = "responses"、结构化 JSON schema;设置HALOGEN_VISION_TOWER后可看图。 - 带贪心一致性检查的推测解码:temperature 为 0 时,输出与串行贪心逐字节相同。0.6.0 起有 draft head 和 prompt lookup。
- 自带 GGUF(0.7.0 起):用同一套 kernel 打开该模型的 llama.cpp GGUF(README 点名 unsloth
UD-IQ4_XS)。 - Agent 套件说明:Pi、OpenCode、Codex CLI、hermes-agent、Cline、Roo Code、aider 对自定义 OpenAI 服务几乎不发思考控制。这些套件真正跑的是服务器默认值。
限制:首次启动大约下载 118 GiB。README 希望 128 GB 统一内存的机器独占给它。free 会虚高,因为锁住的权重看起来像可回收缓存。GPU 不对就起不来。不要把文中 4 倍端到端表当可移植基准。那些行是作者在约 85 W、关闭 IOMMU 的条件下测的 prefill/decode。
适用场景
- Strix Halo 机器(Ryzen AI Max+ 395 一类)要在本地给 Codex 或其他套件提供 Flash-Next。
- 已经有该模型 GGUF,想换这个引擎而不是通用运行时。
- 别用:NVIDIA、Apple Silicon,或不是 gfx1151 的 GPU。
定价方案
| 部分 | 价格 | 2026-09-20 第一方页面 |
|---|---|---|
| 服务镜像 | 运行已发布容器为 $0 | GitHub SPDX Other。约 582 star。README 标签 0.12.0。 |
| 权重 | 下载成本 | peonist-ai/halogen-qwen3.8-flash-next,首次约 118 GiB。 |
| 硬件 | 你的 Strix Halo 机器 | README 参考主机是 128 GB 统一内存。 |
快速开始
- 在 gfx1151 上用 Podman(Docker 把
keep-groups换成--group-add video --group-add render):
podman run --rm -p 8731:8731 \
--device /dev/kfd --device /dev/dri --group-add keep-groups \
--ipc=host --ulimit memlock=-1:-1 \
-e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
-v ~/halogen-models:/models \
ghcr.io/peonist-ai/halogen-flash-server:0.12.0
- 客户端指向
http://<host>:8731/v1。模型名halogen-qwen3.8-flash-next。 - 看
/health确认当前构建真正支持什么。
第一方入口:README。
常见问题
5090 或 M5 能跑吗?
不能。README 写明:只这块硅。
为什么回复是空的?
思考 token 也算进 max_tokens。0.11.0 起有 answer room,给回复留预算尾巴。先看 finish_reason。"length" 表示预算用尽。
4 倍宣称经过审计吗?
那是作者对照已公布的 EngramHalo.cpp、ROCmFP4、CIRU-IU4 数字的表,并写了功耗和 IOMMU 条件。引用前在自己的机器上复现。
替代方案
- mlx-serve:Apple Silicon 上的 Flash-Next 路径。
- ExLlamaV3:NVIDIA 消费级 GPU。
- Qwen3.8-Flash-Next:权重本身,不绑这个引擎。
使用技巧
- 把整机给它。和另一个大进程抢内存,就是 README 里那种假死。
- 套件不发采样字段时,自己设默认。模型卡思考设置为 temperature 1.0、topp 0.95、topk 20。
- 信启动日志里剩余主机内存那一行,不要信
MemAvailable。
总结
halogen-flash-server 是 Qwen3.8-Flash-Next 在 Strix Halo 上的专用服务,不是通用本地 LLM 运行时。GPU 对再上。不对就用 mlx-serve 或 ExLlamaV3。
评论
还没有评论。成为第一个评论的人!