CheaperInference logo

CheaperInference

開く

CheaperInference は割引された AI 推論キャパシティを再販。OpenAI 互換の単一 API で最大 30% 削減、従量課金・契約不要。

共有:

CheaperInference

CheaperInference は、Keak が構築・運営する AI 推論キャパシティのディスカウント再販サービスです。AI 企業が使い切れなかった余剰の推論キャパシティを買い取り、OpenAI 互換の単一 API を通じて再販し、割引の大部分をユーザーに還元することで、リスト価格から最大 30% の削減を実現します。正式なローンチ日は公開されていません。2026 年 8 月に @fabrice_mayrand の X プロモ広告(約 190 万ビュー)を通じて注目を集めました。

主な機能

  • 1 つの API で複数プロバイダーに接続:OpenAI、Anthropic、Google の割引モデル(gpt-5.4、Claude など)を OpenAI 互換の単一エンドポイントで利用でき、リクエスト形式の変更は不要です。
  • 市場連動の割引価格:料金は余剰キャパシティ市場に連動し、オールインレートは公式リスト価格を超えず、ルーティング手数料もありません。
  • 自動フォールバックルーティング:リクエストは価格順にルーティングされ、ネットワーク障害や 404/408/409/425/429/5xx は 1 回リトライ後、次に低コストの利用可能なルートへ切り替わります。
  • ウォレット課金:リクエスト前に残高を確認し、完了後に使用量を差し引きます。自動チャージにも対応。
  • プライバシー:プロンプトとレスポンス本文はアプリのデータベースに保存されません。
  • 価格変更フィードGET /v1/modelspricing_versionpricing_updated_at を返し、モデルごとの 1 時間ごとの観測値と 24 時間/30 日履歴を提供します。

利用シーン

  • AI スタートアップ:チャットボット、コパイロット、RAG パイプラインの推論コストを、統合コードを変えずに削減できます。
  • エージェントワークロード:大量のループ処理が価格順ルーティングと自動フォールバックの恩恵を受けます。
  • チーム・企業:ワークスペース、チームアクセス制御、年間契約不要、初期費用なしで導入できます。

料金

従量課金で、月額コミットや契約は不要。5 ドルから入金でき、初回支払い成功後に 10 ドルのボーナスクレジットが付与されます。オールインレートは公式リスト価格を超えません。

優位性

公式 API 直結との比較:1 つのキーで複数プロバイダーをカバーし、価格順フォールバックにより自前のルーティングコードが不要になります。

OpenRouter との比較:CheaperInference は買い取った余剰キャパシティに基づくディスカウント再販業者であり、マーケットプレイスの広さではなく「リスト価格以下」の確実な安さを売りにしています。

はじめに

  1. 登録:cheaperinference.com でアカウントを作成。
  2. 入金:5 ドル以上の入金で、初回支払い成功時に 10 ドルボーナス。
  3. API キー作成:ダッシュボードで発行。
  4. 2 つの値を変更:ベース URL を https://api.cheaperinference.com/v1 に変更し、新しいキーに差し替え。
  5. そのまま送信:モデル、messages、tools、ストリーミング設定は変更不要。

よくある質問

リクエスト形式の変更は必要ですか?

不要です。ベース URL と API キーだけを変更し、残りは OpenAI 互換のまま使えます。

データは保存されますか?

プロンプトとレスポンス本文はアプリケーションのデータベースに保存されません。

失敗したリクエストはどうなりますか?

対象となる失敗は 1 回リトライされ、その後次に低コストのルートへ切り替わります。

代替案

  • OpenRouter:モデルの豊富さを重視するなら、より広いマルチプロバイダーカタログ。
  • 公式 API 直結:プロバイダー固有機能や個別のコミット割引が必要な場合に適しています。

ヒント

  1. 価格フィードをポーリングpricing_version の変化に合わせてバッチ処理を計画しましょう。
  2. 自動チャージを有効化:残高不足によるリクエスト失敗を防げます。
  3. まず 1 つのワークロードで試験:コストとレイテンシを比較してから全面移行しましょう。

まとめ

CheaperInference はコスト削減に特化したサービスです。OpenAI 形式に対応したスタックなら、最大 30% の削減は 2 行の変更で実現します。価格重視のチームにとって、試す価値のある選択肢です。

コメント

まだコメントがありません。最初のコメントを投稿してください!