NInfer logo

NInfer

開く

NInferは単一のRTX 5090上の指定Qwenチェックポイント向けApache-2.0のC++/CUDA推論エンジンで、OpenAIおよびAnthropic互換のローカルAPIを提供する。

共有:
代替ツールを見る

NInfer は、1 枚の NVIDIA GeForce RTX 5090 上で明示登録された Qwen チェックポイントだけを動かす、ゼロからの C++/CUDA 推論エンジンです。リポジトリ Neroued/ninfer は Apache-2.0、作成日 2026-06-26。2026-09-06 の GitHub は約 1,446 stars。r/LocalLLaMA は Qwen3.8-27B NVFP4 で llama.cpp や vLLM と比較しています。汎用ランナーではありません。GPU 1 枚、常駐モデル 1 つ、起動時に 1〜8 件のアクティブ要求に固定します。

普通のハードウェアで多モデルなら Ollama、モデルカードだけなら Qwen3.8 27B です。

主な機能

  • 登録成果物のみ:README は 5 つの identity(Qwen3.6-27B groupwise-int / NVFP4、Qwen3.8-27B groupwise-int / NVFP4、Qwen3.6-35B-A3B groupwise-int)を挙げます。各 .ninfer はトークナイザ、チャットテンプレート、メディアフロントエンドを埋め込みます。
  • ローカル HTTP API:OpenAI Chat Completions、OpenAI Responses Core、Anthropic Messages。ストリーミング、ツール(解析のみ実行しない)、使用量計上。例は 127.0.0.1:8080
  • 1 枚での長コンテキスト:README 例は --max-context 240000、共有 Device KV、Host State/KV、MTP 投機デコード。
  • マルチモーダル:起動時に --vision を付けると画像、複数画像、動画、混合メッセージ。
  • 公開 5090 数字:README の性能表(RTX 5090、手法記載)では Qwen3.8-27B NVFP4 の同時 MTP3 デコードが C=1 で約 143.8 tok/s、C=8 で 766.6 tok/s。第三者監査ではなく第一当事者ベンチ行です。

制約:Linux + RTX 5090 + CUDA 13.1 + sm_120a のみ。他の CUDA アーキテクチャはビルドが拒否します。マルチ GPU、実行時モデル発見、install ターゲットはありません。任意の Ko-fi は有料席ではありません。

使用シナリオ

  • 5090 を持つ人で、登録済み Qwen 27B / 35B-A3B の単一 GPU デコードを最大化したい人。
  • すでに OpenAI または Anthropic HTTP を話すエージェントで、localhost を指せる人。
  • 5090 が無い人Ollama を使うべきです。

料金プラン

GitHub、2026-09-06。

部分 価格 第一当事者ページの注記
ninfer $0 Apache-2.0。約 1,446 stars。
ハードウェア 自分の 5090 必須。クラウド API ではない。
Ko-fi 任意 README:購入ではない。機能約束もない。

はじめに

  1. 64-bit Linux、RTX 5090、CUDA Toolkit 13.1+ を確認する。
  2. github.com/Neroued/ninfer をクローンし、CMake/Ninja で ninferninfer-serve をビルドする。
  3. 登録成果物を取る。例:hf download neroued/Qwen3.8-27B-nvfp4-NInfer
  4. README の ninfer-serve フラグで起動し、/v1/chat/completions を叩く。

第一当事者資料:NInfer README

よくある質問

Llama や Mixtral は動きますか?

README にはありません。列挙された Qwen 成果物だけです。

4090 や Mac では?

README は sm_120a(5090)以外を拒否すると書きます。コミュニティフォークは別リポジトリです。

Ollama と同じですか?

違います。Ollama は汎用ローカルランナーです。NInfer は 5090 特化エンジンです。

代替案

  • Ollama:多モデルのローカルランナー。
  • Qwen3.8 27B:NInfer のホットパスが囲むモデル。
  • OpenRouter:5090 を持ちたくないときのホスト型マルチベンダー API。

ヒント

  1. 2026-09-06 確認の Apache-2.0、1,446 stars、RTX 5090 限定を引用する。
  2. llama.cpp 級の移植性を宣伝しない。
  3. --kv-capacity auto は起動時にプールを決め、プロセス寿命中は固定です。

まとめ

NInfer は 5090 専用、短い Qwen リスト向けの Apache-2.0 エンジンで、ローカル OpenAI/Anthropic HTTP を出します。github.com/Neroued/ninfer から始め、Ollama が今のハードウェアで足りるか判断してください。

コメント

まだコメントがありません。最初のコメントを投稿してください!