NInfer は、1 枚の NVIDIA GeForce RTX 5090 上で明示登録された Qwen チェックポイントだけを動かす、ゼロからの C++/CUDA 推論エンジンです。リポジトリ Neroued/ninfer は Apache-2.0、作成日 2026-06-26。2026-09-06 の GitHub は約 1,446 stars。r/LocalLLaMA は Qwen3.8-27B NVFP4 で llama.cpp や vLLM と比較しています。汎用ランナーではありません。GPU 1 枚、常駐モデル 1 つ、起動時に 1〜8 件のアクティブ要求に固定します。
普通のハードウェアで多モデルなら Ollama、モデルカードだけなら Qwen3.8 27B です。
主な機能
- 登録成果物のみ:README は 5 つの identity(Qwen3.6-27B groupwise-int / NVFP4、Qwen3.8-27B groupwise-int / NVFP4、Qwen3.6-35B-A3B groupwise-int)を挙げます。各
.ninferはトークナイザ、チャットテンプレート、メディアフロントエンドを埋め込みます。 - ローカル HTTP API:OpenAI Chat Completions、OpenAI Responses Core、Anthropic Messages。ストリーミング、ツール(解析のみ実行しない)、使用量計上。例は
127.0.0.1:8080。 - 1 枚での長コンテキスト:README 例は
--max-context 240000、共有 Device KV、Host State/KV、MTP 投機デコード。 - マルチモーダル:起動時に
--visionを付けると画像、複数画像、動画、混合メッセージ。 - 公開 5090 数字:README の性能表(RTX 5090、手法記載)では Qwen3.8-27B NVFP4 の同時 MTP3 デコードが C=1 で約 143.8 tok/s、C=8 で 766.6 tok/s。第三者監査ではなく第一当事者ベンチ行です。
制約:Linux + RTX 5090 + CUDA 13.1 + sm_120a のみ。他の CUDA アーキテクチャはビルドが拒否します。マルチ GPU、実行時モデル発見、install ターゲットはありません。任意の Ko-fi は有料席ではありません。
使用シナリオ
- 5090 を持つ人で、登録済み Qwen 27B / 35B-A3B の単一 GPU デコードを最大化したい人。
- すでに OpenAI または Anthropic HTTP を話すエージェントで、localhost を指せる人。
- 5090 が無い人は Ollama を使うべきです。
料金プラン
GitHub、2026-09-06。
| 部分 | 価格 | 第一当事者ページの注記 |
|---|---|---|
| ninfer | $0 | Apache-2.0。約 1,446 stars。 |
| ハードウェア | 自分の 5090 | 必須。クラウド API ではない。 |
| Ko-fi | 任意 | README:購入ではない。機能約束もない。 |
はじめに
- 64-bit Linux、RTX 5090、CUDA Toolkit 13.1+ を確認する。
- github.com/Neroued/ninfer をクローンし、CMake/Ninja で
ninferとninfer-serveをビルドする。 - 登録成果物を取る。例:
hf download neroued/Qwen3.8-27B-nvfp4-NInfer。 - README の
ninfer-serveフラグで起動し、/v1/chat/completionsを叩く。
第一当事者資料:NInfer README。
よくある質問
Llama や Mixtral は動きますか?
README にはありません。列挙された Qwen 成果物だけです。
4090 や Mac では?
README は sm_120a(5090)以外を拒否すると書きます。コミュニティフォークは別リポジトリです。
Ollama と同じですか?
違います。Ollama は汎用ローカルランナーです。NInfer は 5090 特化エンジンです。
代替案
- Ollama:多モデルのローカルランナー。
- Qwen3.8 27B:NInfer のホットパスが囲むモデル。
- OpenRouter:5090 を持ちたくないときのホスト型マルチベンダー API。
ヒント
- 2026-09-06 確認の Apache-2.0、1,446 stars、RTX 5090 限定を引用する。
- llama.cpp 級の移植性を宣伝しない。
--kv-capacity autoは起動時にプールを決め、プロセス寿命中は固定です。
まとめ
NInfer は 5090 専用、短い Qwen リスト向けの Apache-2.0 エンジンで、ローカル OpenAI/Anthropic HTTP を出します。github.com/Neroued/ninfer から始め、Ollama が今のハードウェアで足りるか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!