NInfer logo

NInfer

打开

NInfer 是 Apache-2.0 的 C++/CUDA 推理引擎,面向单张 RTX 5090 上的指定 Qwen 权重,提供兼容 OpenAI 与 Anthropic 的本地 API。

分享:
查看替代方案

NInfer 是从零写的 C++/CUDA 推理引擎,只跑一张 NVIDIA GeForce RTX 5090 上明确注册过的 Qwen 权重。仓库 Neroued/ninfer 使用 Apache-2.0,创建于 2026-06-26。2026-09-06 GitHub 显示约 1,446 star。r/LocalLLaMA 在拿它和 llama.cpp、vLLM 比 Qwen3.8-27B NVFP4。它不是通用模型运行器:一块 GPU、一个常驻模型、启动时固定 1 到 8 个活跃请求。

若要在普通硬件上跑很多模型,用 Ollama;只要模型卡片,看 Qwen3.8 27B

核心功能

  • 只认注册产物:README 列了五个身份(Qwen3.6-27B groupwise-int / NVFP4、Qwen3.8-27B groupwise-int / NVFP4、Qwen3.6-35B-A3B groupwise-int)。每个 .ninfer 文件内嵌分词器、聊天模板和媒体前端。
  • 本地 HTTP API:OpenAI Chat Completions、OpenAI Responses Core、Anthropic Messages,含流式、工具(只解析不执行)和用量记账。示例默认听 127.0.0.1:8080
  • 单卡长上下文:README 例子用 --max-context 240000,共享 Device KV 池、Host State/KV 分层,以及 MTP 投机解码。
  • 多模态路径:启动时打开 --vision 后支持图片、多图、视频和混合消息。
  • 公开的 5090 数字:README 性能表(RTX 5090,有方法说明)里,Qwen3.8-27B NVFP4 并发 MTP3 解码大约 C=1 时 143.8 tok/s、C=8 时 766.6 tok/s。当作第一方基准行,不是第三方审计。

限制:只要 Linux + RTX 5090 + CUDA 13.1 + sm_120a。构建会拒绝其他 CUDA 架构。没有多卡、没有运行时模型发现、没有 install 目标。可选 Ko-fi 支持不是付费席位。

适用场景

  • 有 5090 的人,想在已注册的 Qwen 27B / 35B-A3B 产物上把单卡解码拉满。
  • 已经会说 OpenAI 或 Anthropic HTTP 的 Agent 套件,可以把地址指到 localhost。
  • 没有 5090 的人,应该改用 Ollama

定价方案

GitHub,2026-09-06。

部分 价格 第一方页面说明
ninfer $0 Apache-2.0。约 1,446 star。
硬件 你的 5090 必需。不是云 API。
Ko-fi 自愿 README:不是购买,不承诺功能。

快速开始

  1. 确认 64 位 Linux 主机有 RTX 5090 和 CUDA Toolkit 13.1+。
  2. 克隆 github.com/Neroued/ninfer,用 CMake/Ninja 编出 ninferninfer-serve
  3. 下载注册产物,例如 hf download neroued/Qwen3.8-27B-nvfp4-NInfer
  4. 按 README 的 ninfer-serve 参数启动,再打 /v1/chat/completions

第一方资料:NInfer README

常见问题

能跑 Llama 或 Mixtral 吗?

README 没有。只有列出的 Qwen 产物。

能在 4090 或 Mac 上跑吗?

README 写构建拒绝 sm_120a(5090)以外的 CUDA 架构。社区 fork 存在,但不是这个仓库。

和 Ollama 一样吗?

不一样。Ollama 是通用本地运行器。NInfer 是特化的 5090 引擎。

替代方案

  • Ollama:很多模型的本地运行器。
  • Qwen3.8 27B:NInfer 热路径围绕的模型。
  • OpenRouter:不想买 5090 时的托管多厂商 API。

使用技巧

  1. 引用 2026-09-06 核对的 Apache-2.0、1,446 star,以及仅 RTX 5090。
  2. 不要宣传 llama.cpp 那种可移植性。
  3. --kv-capacity auto 只在启动时定池子大小,进程生命周期内固定。

总结

NInfer 是只认 5090、只认短名单 Qwen 权重的 Apache-2.0 引擎,带本地 OpenAI/Anthropic HTTP。从 github.com/Neroued/ninfer 开始,再判断 Ollama 是否已经覆盖你实际拥有的硬件。

评论

还没有评论。成为第一个评论的人!