halogen-flash-server logo

halogen-flash-server

打开

halogen-flash-server 是面向 Strix Halo 的推理服务,用 OpenAI 兼容 API 跑 Qwen3.8-Flash-Next。

分享:
查看替代方案

halogen-flash-server(halogen)是为一块 GPU 和一个模型家族写的推理服务:AMD Strix Halo(gfx1151)和 Qwen3.8-Flash-Next。仓库 peonist-ai/halogen-flash-server 创建于 2026-08-26。2026-09-20 GitHub 显示 582 star33 fork。582 star 是热度信号,不是访问量。GitHub SPDX 为 Other。二次分发前先读 LICENSE.md。权重在 Hugging Face。2026-09-20 README 快速开始引用的镜像标签是 0.12.0。r/LocalLLaMA 讨论过用这套在 Strix Halo 上跑 1M 上下文。

它不是通用的 vLLM 或 llama.cpp 替代。Apple Silicon 对照 mlx-serve,NVIDIA 消费级 GPU 对照 ExLlamaV3,跨系统运行器对照 Ollama

核心功能

  • 单硅内核:README 的说法是每个 kernel 只为这块 GPU 和这个模型家族服务,没有可移植回退。这也是为什么别的 GPU 起不来。
  • OpenAI 兼容 /v1:Chat Completions 与 Responses、工具调用、Codex CLI 的 wire_api = "responses"、结构化 JSON schema;设置 HALOGEN_VISION_TOWER 后可看图。
  • 带贪心一致性检查的推测解码:temperature 为 0 时,输出与串行贪心逐字节相同。0.6.0 起有 draft head 和 prompt lookup。
  • 自带 GGUF(0.7.0 起):用同一套 kernel 打开该模型的 llama.cpp GGUF(README 点名 unsloth UD-IQ4_XS)。
  • Agent 套件说明:Pi、OpenCode、Codex CLI、hermes-agent、Cline、Roo Code、aider 对自定义 OpenAI 服务几乎不发思考控制。这些套件真正跑的是服务器默认值。

限制:首次启动大约下载 118 GiB。README 希望 128 GB 统一内存的机器独占给它。free 会虚高,因为锁住的权重看起来像可回收缓存。GPU 不对就起不来。不要把文中 4 倍端到端表当可移植基准。那些行是作者在约 85 W、关闭 IOMMU 的条件下测的 prefill/decode。

适用场景

  • Strix Halo 机器(Ryzen AI Max+ 395 一类)要在本地给 Codex 或其他套件提供 Flash-Next。
  • 已经有该模型 GGUF,想换这个引擎而不是通用运行时。
  • 别用:NVIDIA、Apple Silicon,或不是 gfx1151 的 GPU。

定价方案

部分 价格 2026-09-20 第一方页面
服务镜像 运行已发布容器为 $0 GitHub SPDX Other。约 582 star。README 标签 0.12.0。
权重 下载成本 peonist-ai/halogen-qwen3.8-flash-next,首次约 118 GiB。
硬件 你的 Strix Halo 机器 README 参考主机是 128 GB 统一内存。

快速开始

  1. 在 gfx1151 上用 Podman(Docker 把 keep-groups 换成 --group-add video --group-add render):
podman run --rm -p 8731:8731 \
  --device /dev/kfd --device /dev/dri --group-add keep-groups \
  --ipc=host --ulimit memlock=-1:-1 \
  -e HALOGEN_DOWNLOAD=peonist-ai/halogen-qwen3.8-flash-next \
  -v ~/halogen-models:/models \
  ghcr.io/peonist-ai/halogen-flash-server:0.12.0
  1. 客户端指向 http://<host>:8731/v1。模型名 halogen-qwen3.8-flash-next
  2. /health 确认当前构建真正支持什么。

第一方入口:README

常见问题

5090 或 M5 能跑吗?

不能。README 写明:只这块硅。

为什么回复是空的?

思考 token 也算进 max_tokens。0.11.0 起有 answer room,给回复留预算尾巴。先看 finish_reason"length" 表示预算用尽。

4 倍宣称经过审计吗?

那是作者对照已公布的 EngramHalo.cpp、ROCmFP4、CIRU-IU4 数字的表,并写了功耗和 IOMMU 条件。引用前在自己的机器上复现。

替代方案

使用技巧

  1. 把整机给它。和另一个大进程抢内存,就是 README 里那种假死。
  2. 套件不发采样字段时,自己设默认。模型卡思考设置为 temperature 1.0、topp 0.95、topk 20。
  3. 信启动日志里剩余主机内存那一行,不要信 MemAvailable

总结

halogen-flash-server 是 Qwen3.8-Flash-Next 在 Strix Halo 上的专用服务,不是通用本地 LLM 运行时。GPU 对再上。不对就用 mlx-serve 或 ExLlamaV3。

评论

还没有评论。成为第一个评论的人!