Orukeet 是 Oruk AI 的 25 语言语音识别器,基于 NVIDIA Parakeet TDT 0.6B v3。仓库 Oruk-AI/orukeet 代码为 MIT,创建于 2026-09-09,语言 Python。权重和拟合核是 CC BY-SA 4.0。2026-09-12 GitHub 显示 30 star、1 fork。Hugging Face 卡片 显示 13 likes、近 30 天 2,444 次下载。r/LocalLLaMA 当天热门 RSS 标题是「Orukeet, new ASR model based on Parakeet」。
对照 Whisper V3 若你要 OpenAI 的 MIT 开源权重家族,对照 YouTube Transcript 若你要从 URL 抽字幕,对照 Nex-N2.5-mini 若你要多模态智能体而不是 ASR。
核心功能
- 冻结一半 Gabor:卡片写明保留 Parakeet 的 627,008,134 参数和 24 层 FastConformer,把编码器时间深度卷积滤波器的一半换成 12,288 个拟合并冻结的 Gabor 核。原生导出把这些 tap 存成普通 F16 卷积权重。
- 相对 Parakeet 的第一方 WER(NeMo greedy-batch TDT,同一批录音):LibriSpeech test-clean 1.46% vs 1.53%,test-other 2.86% vs 3.14%,FLEURS 英语 3.82% vs 4.28%,FLEURS 25 语言合计 9.85% vs 11.01%(相对降 10.6%)。卡片称 74 个划分里赢了 61 个。
- r3 四种格式(
031c8ddab484):NeMo 源、原生 Q8、原生 F16、给 sherpa-onnx 的 ONNX INT8。OpenWhispr 1.10.0 把它列为推荐本地模型。 - 安装器:
orukeet install --device auto在苹果芯片选 Metal,NVIDIA 选 CUDA,否则 CPU。需要 Python 3.12+。
局限:30 star 是第三天的热度,不是审计。最后一轮适配和选 checkpoint 用的是 LibriSpeech test-other,和 WER 表里同一划分。我们没有重跑那 74 组。原生输出是文本加窗口时间;没有说话人分离、情绪或说话人标签。
规格
| 项 | 值 | 来源 |
|---|---|---|
| 参数量 | 627,008,134(沿用 Parakeet) | HF 卡片 |
| 代码 / 权重 | MIT / CC BY-SA 4.0 | 同一卡片,2026-09-12 |
| 语言 | 25(FLEURS 集合) | HF cardData.language |
| Likes / 近 30 天下载 | 13 / 2,444 | HF API,2026-09-12 |
| GitHub star | 30 | GitHub API,2026-09-12 |
| 软件价格 | 代码和权重 $0 | MIT + CC BY-SA 4.0 |
适用场景
- 本地转写,苹果芯片或 CUDA 机器,包括 OpenWhispr 本地选择器(Oruk → Orukeet)。
- 在比较 Parakeet TDT 0.6B v3、想要 Gabor 冻结检查点而不是从零训 ASR 的人。
- r/LocalLLaMA 读者,当天在热门列表看到标题。
若你要的是托管 API 默认模型,先确认 Whisper V3 仍是你要的开源仓库,而不是计费 SKU。
快速开始
- 打开 oruk/orukeet 或 本地转写指南。
- 从 GitHub Releases 用
python -m pip install装 v0.1.1 wheel,再跑orukeet install --device auto。 - 读取
installation.json,调用Orukeet(...).transcribe("recording.wav")。 - 或在 OpenWhispr 1.10.0 里选 Local → Oruk → Orukeet。
常见问题
这就是 NVIDIA Parakeet 吗?
它从 Parakeet TDT 0.6B v3 出发,冻结拟合的 Gabor 核。权重上仍保留 NVIDIA 署名(CC BY-SA 4.0)。
可以不用 NeMo 吗?
可以。原生 Q8/F16 和 sherpa-onnx 的 INT8 包不需要 NeMo。卡片上的 WER 表是 NeMo FP32/BF16,不是原生运行时。
为什么 test-other 既在训练里又在榜上?
卡片写最后 168 次 AdamW 和选 checkpoint 都用 LibriSpeech test-other。把它当成构造选择,不是留出审计。
替代方案
- Whisper V3:OpenAI MIT 开源权重家族。
- YouTube Transcript:从视频 URL 抽字幕,不是本地 ASR。
- Nex-N2.5-mini:智能体检查点,不是语音识别。
使用技巧
- 跨文件保持 worker 常驻。重新加载的开销不在 WER 表里。
- 钉死 revision。NeMo/原生文件用
555136b50265a132d4cea0d35560c26fc4f657ab;ONNX 是另一个 commit。 - 不要把 FLEURS 合计相对降 10.6% 写成产品 SLA。那是一组第一方对照。
Orukeet 是 r/LocalLLaMA 在 2026-09-12 链到的 CC BY-SA Parakeet 分支。从 Hugging Face 卡片开始,再决定 Whisper 是否已经覆盖你要的语言。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。
Windows 上把 OpenCode Go 接进 Codex,别再新开一套工具
ChatGPT 登录的 Codex 桌面版,默认选择器几乎只露出 GPT。Windows 上只开 OpenCode Go 这一家,就能把已经付过钱的 Grok、GLM、Kimi、DeepSeek、MiniMax 接回同一个 picker。密钥不出本机,原生 GPT 也不动。