Orukeet logo

Orukeet

打开

Orukeet 是覆盖 25 种语言的语音识别模型,在 NVIDIA Parakeet TDT 0.6B v3 上冻结拟合的 Gabor 核。

分享:
查看替代方案

Orukeet 是 Oruk AI 的 25 语言语音识别器,基于 NVIDIA Parakeet TDT 0.6B v3。仓库 Oruk-AI/orukeet 代码为 MIT,创建于 2026-09-09,语言 Python。权重和拟合核是 CC BY-SA 4.0。2026-09-12 GitHub 显示 30 star1 forkHugging Face 卡片 显示 13 likes、近 30 天 2,444 次下载。r/LocalLLaMA 当天热门 RSS 标题是「Orukeet, new ASR model based on Parakeet」。

对照 Whisper V3 若你要 OpenAI 的 MIT 开源权重家族,对照 YouTube Transcript 若你要从 URL 抽字幕,对照 Nex-N2.5-mini 若你要多模态智能体而不是 ASR。

核心功能

  • 冻结一半 Gabor:卡片写明保留 Parakeet 的 627,008,134 参数和 24 层 FastConformer,把编码器时间深度卷积滤波器的一半换成 12,288 个拟合并冻结的 Gabor 核。原生导出把这些 tap 存成普通 F16 卷积权重。
  • 相对 Parakeet 的第一方 WER(NeMo greedy-batch TDT,同一批录音):LibriSpeech test-clean 1.46% vs 1.53%,test-other 2.86% vs 3.14%,FLEURS 英语 3.82% vs 4.28%,FLEURS 25 语言合计 9.85% vs 11.01%(相对降 10.6%)。卡片称 74 个划分里赢了 61 个
  • r3 四种格式031c8ddab484):NeMo 源、原生 Q8、原生 F16、给 sherpa-onnx 的 ONNX INT8。OpenWhispr 1.10.0 把它列为推荐本地模型。
  • 安装器orukeet install --device auto 在苹果芯片选 Metal,NVIDIA 选 CUDA,否则 CPU。需要 Python 3.12+。

局限:30 star 是第三天的热度,不是审计。最后一轮适配和选 checkpoint 用的是 LibriSpeech test-other,和 WER 表里同一划分。我们没有重跑那 74 组。原生输出是文本加窗口时间;没有说话人分离、情绪或说话人标签。

规格

来源
参数量 627,008,134(沿用 Parakeet) HF 卡片
代码 / 权重 MIT / CC BY-SA 4.0 同一卡片,2026-09-12
语言 25(FLEURS 集合) HF cardData.language
Likes / 近 30 天下载 13 / 2,444 HF API,2026-09-12
GitHub star 30 GitHub API,2026-09-12
软件价格 代码和权重 $0 MIT + CC BY-SA 4.0

适用场景

  • 本地转写,苹果芯片或 CUDA 机器,包括 OpenWhispr 本地选择器(Oruk → Orukeet)。
  • 在比较 Parakeet TDT 0.6B v3、想要 Gabor 冻结检查点而不是从零训 ASR 的人。
  • r/LocalLLaMA 读者,当天在热门列表看到标题。

若你要的是托管 API 默认模型,先确认 Whisper V3 仍是你要的开源仓库,而不是计费 SKU。

快速开始

  1. 打开 oruk/orukeet本地转写指南
  2. 从 GitHub Releases 用 python -m pip install 装 v0.1.1 wheel,再跑 orukeet install --device auto
  3. 读取 installation.json,调用 Orukeet(...).transcribe("recording.wav")
  4. 或在 OpenWhispr 1.10.0 里选 Local → Oruk → Orukeet

第一方资料:模型卡片oruk.ai

常见问题

这就是 NVIDIA Parakeet 吗?

它从 Parakeet TDT 0.6B v3 出发,冻结拟合的 Gabor 核。权重上仍保留 NVIDIA 署名(CC BY-SA 4.0)。

可以不用 NeMo 吗?

可以。原生 Q8/F16 和 sherpa-onnx 的 INT8 包不需要 NeMo。卡片上的 WER 表是 NeMo FP32/BF16,不是原生运行时。

为什么 test-other 既在训练里又在榜上?

卡片写最后 168 次 AdamW 和选 checkpoint 都用 LibriSpeech test-other。把它当成构造选择,不是留出审计。

替代方案

使用技巧

  1. 跨文件保持 worker 常驻。重新加载的开销不在 WER 表里。
  2. 钉死 revision。NeMo/原生文件用 555136b50265a132d4cea0d35560c26fc4f657ab;ONNX 是另一个 commit。
  3. 不要把 FLEURS 合计相对降 10.6% 写成产品 SLA。那是一组第一方对照。

Orukeet 是 r/LocalLLaMA 在 2026-09-12 链到的 CC BY-SA Parakeet 分支。从 Hugging Face 卡片开始,再决定 Whisper 是否已经覆盖你要的语言。

评论

还没有评论。成为第一个评论的人!