Realtime-Venus logo

Realtime-Venus

打开

Realtime-Venus 是 Apache 2.0 的 9B 全双工音视频模型,能在继续听的同时说话、被打断、并委派任务。

分享:
查看替代方案

Realtime-Venus 是 inclusionAI 的流式音视频交互系统。权重在 inclusionAI/Realtime-Venus,创建于 2026-09-16,Apache 2.0。论文是 arXiv:2609.13814。2026-09-19 Hugging Face 显示 18 likes,GitHub 显示 11 star。这是早期热度,不是访问量。r/LocalLLaMA 当周打了 New Model 标签。

它和 Ling-3.0-flash 同实验室。Omni 检查点改编自 MiniCPM-o 4.5,语言骨干是 Qwen3-8B。本地文本 27B 看 Qwen3.8-27B

核心功能

  • 两个 9B 检查点Realtime-Venus-Omni(视频 + 音频 + 文本进,文本和语音出)和 Realtime-Venus-Audio(音频 + 文本进)。都是 BF16,上下文 40,960 token。
  • 全双工:模型卡称说话时仍在感知,并区分附和、打断、纠正和改道。
  • 主动开口:Omni 连续看对齐的视频和音频,可以不打字就起一轮。
  • 委派:在共享时间线上发 <delegate>。真正跑工具需要 GitHub 上的 Realtime-Venus-Harness,不是权重仓单独能做的。
  • 免训练的长视频记忆:归档有信息量的片段,查询时再取回。

限制:2026-09-19 只有 18 likes / 11 star,运行时很新。没有 harness,委派没有用。9B BF16 也不是 6 GB 三值笔记本包。

适用场景

  • 一直开着摄像头/麦克风、必须能中途打断的智能体。
  • 实验室 复现论文的双工和委派。
  • 不要选它 如果只要文本编程 CLI。用 MiniMax Code

定价方案

部分 价格 2026-09-19 第一方页面
权重 $0 Hugging Face 和 ModelScope 上 Apache 2.0。18 likes。
Harness $0 GitHub 运行时。11 star。

快速开始

  1. 打开 模型卡,选 Omni 或 Audio。
  2. 需要 harness 和 demo 就 clone inclusionAI/Realtime-Venus
  3. 跟仓库里的 install.sh / start.sh。不要指望只靠 Transformers 权重就能跑 <delegate>
  4. 论文图看 项目页

第一方入口:READMEarXiv:2609.13814

常见问题

这是 MiniCPM-o 吗?

模型卡写 Omni 改编自 MiniCPM-o 4.5 / Omni-Flow,视觉 SigLIP2,音频 Whisper-Medium,文本 Qwen3-8B。

没有摄像头能跑吗?

能。用 Audio 检查点。

为什么 star 这么少?

GitHub 仓日期是 2026-09-16。把 11 star 当新鲜度,不当质量分。

替代方案

使用技巧

  1. 不传视频就别加载 Omni。推理时 Audio 更省。
  2. 在乎 <delegate> 就把 harness 和权重放一起。
  3. 论文数字只从 arXiv 引,别从社交帖抄。

总结

Realtime-Venus 是 9B 的 Apache 双工音视频模型,给愿意跑 inclusionAI harness 的人,不是即插即用的聊天 API。从 Hugging Face 模型卡起步,需要打断和委派再 clone GitHub 运行时。它还早:18 likes 不是你该拿去赌产品的人气。

评论

还没有评论。成为第一个评论的人!