Orukeet は Oruk AI の 25 言語音声認識器で、NVIDIA Parakeet TDT 0.6B v3 を土台にします。リポジトリ Oruk-AI/orukeet のコードは MIT、作成日 2026-09-09、言語は Python。重みと適合カーネルは CC BY-SA 4.0。2026-09-12 の GitHub は 30 stars、1 fork。Hugging Face カード は 13 likes、直近 30 日 2,444 ダウンロード。r/LocalLLaMA 同日のホット RSS 見出しは「Orukeet, new ASR model based on Parakeet」でした。
対照は Whisper V3(OpenAI の MIT オープンウェイト家族)、YouTube Transcript(URL から字幕)、Nex-N2.5-mini(ASR ではなくマルチモーダルエージェント)。
主な機能
- Gabor 半分を凍結:カードは Parakeet の 627,008,134 パラメータと 24 層 FastConformer を残し、エンコーダの時間方向 depthwise フィルタの半分を 12,288 個の適合・凍結 Gabor カーネルに置き換えると書きます。ネイティブ出力ではその tap は普通の F16 畳み込み重みです。
- Parakeet との一次 WER(NeMo greedy-batch TDT、同一録音):LibriSpeech test-clean 1.46% vs 1.53%、test-other 2.86% vs 3.14%、FLEURS 英語 3.82% vs 4.28%、FLEURS 25 言語合計 9.85% vs 11.01%(相対 10.6% 減)。カードは 74 分割中 61 で勝ったと書きます。
- r3 の 4 形式(
031c8ddab484):NeMo ソース、ネイティブ Q8、ネイティブ F16、sherpa-onnx 向け ONNX INT8。OpenWhispr 1.10.0 は推奨ローカルモデルとして同梱します。 - インストーラ:
orukeet install --device autoは Apple silicon で Metal、NVIDIA で CUDA、それ以外は CPU。Python 3.12+。
限界:30 stars は公開 3 日目の熱量であり監査ではありません。最終適応とチェックポイント選択は LibriSpeech test-other を使い、WER 表と同じ分割です。74 分割は再実行していません。ネイティブ応答はテキストと窓時間だけで、話者分離・感情・話者ラベルはありません。
仕様
| 項目 | 値 | 出典 |
|---|---|---|
| パラメータ | 627,008,134(Parakeet を維持) | HF カード |
| コード / 重み | MIT / CC BY-SA 4.0 | 同カード、2026-09-12 |
| 言語 | 25(FLEURS セット) | HF cardData.language |
| Likes / 直近 30 日 DL | 13 / 2,444 | HF API、2026-09-12 |
| GitHub stars | 30 | GitHub API、2026-09-12 |
| ソフトウェア価格 | コードと重み $0 | MIT + CC BY-SA 4.0 |
使用シナリオ
- ローカル書き起こし。Apple silicon または CUDA。OpenWhispr のローカル選択(Oruk → Orukeet)も含む。
- Parakeet TDT 0.6B v3 を比較する人で、ゼロから ASR を訓練せず Gabor 凍結チェックポイントが欲しい場合。
- r/LocalLLaMA の読者。その日ホットリストに見出しがありました。
ホスト API のデフォルトが欲しいなら、Whisper V3 が今も意図したオープンリポジトリか、課金 SKU かを先に確認してください。
はじめに
- oruk/orukeet または ローカル書き起こしガイド を開く。
- GitHub Releases の v0.1.1 wheel を
python -m pip installし、orukeet install --device auto。 installation.jsonを読み、Orukeet(...).transcribe("recording.wav")。- または OpenWhispr 1.10.0 で Local → Oruk → Orukeet。
よくある質問
これは NVIDIA Parakeet ですか?
Parakeet TDT 0.6B v3 から始め、適合した Gabor カーネルを凍結します。重みには NVIDIA の帰属が残ります(CC BY-SA 4.0)。
NeMo は省略できますか?
できます。ネイティブ Q8/F16 と sherpa-onnx の INT8 アーカイブは NeMo 不要です。カードの WER 表は NeMo FP32/BF16 であり、ネイティブ実行系ではありません。
なぜ test-other が訓練と表の両方にありますか?
カードは最後の 168 回の AdamW とチェックポイント選択が LibriSpeech test-other を使うと書きます。ホールドアウト監査ではなく、構築上の選択として読んでください。
代替案
- Whisper V3:OpenAI の MIT オープンウェイト家族。
- YouTube Transcript:動画 URL から字幕。ローカル ASR ではない。
- Nex-N2.5-mini:エージェントチェックポイント。音声認識ではない。
ヒント
- ファイルをまたいで worker を常駐させる。再ロードコストは WER 表に入っていません。
- revision を固定。NeMo/ネイティブは
555136b50265a132d4cea0d35560c26fc4f657ab、ONNX は別コミットです。 - FLEURS 合計の相対 10.6% 減を製品 SLA にしないでください。一次の 1 比較です。
Orukeet は r/LocalLLaMA が 2026-09-12 にリンクした CC BY-SA の Parakeet 派生です。Hugging Face カードから始め、Whisper で言語が足りるか判断してください。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Grok Bot と Hermes Bot:一人に、ようやく参謀本部と事務局がつく
Grok Bot は Cursor Pro+ に入った。Hermes Bot は VPS で走る。より賢いチャット窓ではない。助言するのは参謀本部、実行するのは事務局、決裁するのはあなただ。
Windows で OpenCode Go を Codex に繋ぐ。二セット目のツールは開くな
ChatGPT でログインした Codex デスクトップは、ピッカーにほぼ GPT しか出さない。Windows では OpenCode Go だけを開けば、すでに課金している Grok、GLM、Kimi、DeepSeek、MiniMax が同じセレクタに戻る。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。
Codex を閉じ込めているのはモデルではなく、ピッカーだ
OpenCode Go、Grok、Z.ai にはすでに課金しているのに、Codex のピッカーはほぼ GPT しか出さない。コミュニティ製の codex-router が教えるのは手順ではない。すでに買ったモデル能力をセレクタに戻すこと。鍵はマシンから出ず、ネイティブ GPT もそのまま残る。