Realtime-Venus logo

Realtime-Venus

開く

Realtime-Venus は Apache 2.0 の 9B 全二重オーディオビジュアルモデル。聞きながら話し、割り込みを受け、委譲できる。

共有:
代替ツールを見る

Realtime-Venus は inclusionAI のストリーミング音響視覚インタラクション系です。重みは inclusionAI/Realtime-Venus、作成日 2026-09-16、Apache 2.0。論文は arXiv:2609.13814。2026-09-19 の Hugging Face は 18 likes、GitHub は 11 stars。初期の熱量であり、トラフィックではありません。r/LocalLLaMA は同じ週に New Model を付けました。

同じ研究室の Ling-3.0-flash があります。Omni チェックポイントは MiniCPM-o 4.5 由来で、言語バックボーンは Qwen3-8B。ローカルのテキスト 27B なら Qwen3.8-27B です。

主な機能

  • 9B チェックポイントが 2 つRealtime-Venus-Omni(映像 + 音声 + テキスト入力、テキストと音声出力)と Realtime-Venus-Audio(音声 + テキスト入力)。どちらも BF16、コンテキスト 40,960 トークン。
  • 全二重:カードは発話中も知覚を続け、相槌、割り込み、訂正、方向転換を分けると書く。
  • 能動発話:Omni は揃った映像と音声を見続け、入力なしでもターンを始められる。
  • 委譲:共有タイムライン上の <delegate>。実行には GitHub の Realtime-Venus-Harness が要り、重みリポジトリだけでは足りない。
  • 追加学習なしの長尺映像メモリ:情報量のある瞬間を蓄え、クエリ時に取り出す。

制約:2026-09-19 時点で 18 likes / 11 stars。ランタイムは新しい。ハーネスなしでは委譲は役に立たない。9B BF16 は 6 GB の三値ノート用パックではない。

使用シナリオ

  • カメラとマイクを常時つけ、文の途中で止められる エージェント
  • 論文の全二重と委譲を再現する 研究室
  • テキストのコーディング CLI だけなら 選ばないMiniMax Code を使う。

料金プラン

部分 価格 2026-09-19 の第一者ページ
重み $0 Hugging Face と ModelScope の Apache 2.0。18 likes。
Harness $0 GitHub ランタイム。11 stars。

はじめに

  1. モデルカード で Omni か Audio を選ぶ。
  2. ハーネスとデモが要るなら inclusionAI/Realtime-Venus を clone。
  3. そのリポジトリの install.sh / start.sh に従う。Transformers の重みだけでは <delegate> は走らない。
  4. 論文図は プロジェクトページ

第一者の起点は READMEarXiv:2609.13814 です。

よくある質問

MiniCPM-o ですか?

カードは Omni が MiniCPM-o 4.5 / Omni-Flow 由来で、視覚 SigLIP2、音声 Whisper-Medium、テキスト Qwen3-8B だと書きます。

カメラなしで動きますか?

はい。Audio チェックポイントを使う。

stars が少ないのは?

GitHub リポジトリの日付は 2026-09-16。11 stars は新しさの信号であり、品質点ではない。

代替案

ヒント

  1. 映像を渡さないなら Omni を載せない。推論時は Audio の方が軽い。
  2. <delegate> が要るならハーネスを重みの隣に置く。
  3. 論文の数字は arXiv からだけ引く。SNS からは引かない。

まとめ

Realtime-Venus は inclusionAI のハーネスを回す人向けの 9B Apache 全二重 AV モデルであり、差し込みチャット API ではない。Hugging Face のカードから始め、割り込みと委譲が要るなら GitHub ランタイムを clone する。まだ早い。18 likes は製品を賭ける人気ではない。

コメント

まだコメントがありません。最初のコメントを投稿してください!