Qwen-Audio-3.1 logo

Qwen-Audio-3.1

開く

Alibaba の Qwen-Audio-3.1 は ASR-Next と TTS-Next を追加。TTS は Artificial Analysis の音声合成ランキングで首位、API 価格は最大 95% 値下げ。

共有:
代替ツールを見る

Qwen-Audio-3.1

Qwen-Audio-3.1 は、Alibaba が 2026-09-23 に公式アカウントから発表した音声モデル群の刷新です。単一のモデルではなく五つのモデルからなるスタックで、既存の ASRTTSRealtime が更新され、さらに ASR-Next(音声理解)と TTS-Next(音声制作)が加わりました。

多くのチームにとって最大のニュースは価格です。公式発表では TTS が約 70% 減、Realtime が約 85% 減、ASR が最大 95% 減。分単位で課金される音声業務では、この下げ幅がそのままコスト構造を変えます。

スタックに含まれるモデル

モデル 役割 Qwen Cloud の API id
ASR 多言語・方言の文字起こし。フィラーや繰り返しを自動で除去する整形付き qwen-audio-3.1-asr-flash-filetrans
ASR-Next 話者ラベル、タイムスタンプ、整列テキストに対応した複数話者認識。感情や環境音も理解 発表済み、API は準備中
TTS 指示による制御が可能な音声合成。クロスリンガルな声質転送に対応 qwen-audio-3.1-tts-flash
TTS-Next 統一 LM と拡散フレームワークで声・効果音・BGM を一度に生成 発表済み、API は準備中
Realtime 全二重のリアルタイム音声。割り込みと共感的な応答に対応 qwen-audio-3.1-realtime-plus

TTS モデルの詳細

公式の技術解説によると、Qwen-Audio-3.1-TTS は実運用向けの音声合成システムで、12.5 Hz の低フレームレート音声トークナイザと五段階のトレーニングで構成されます。言語モデルとフローマッチングの個別事前学習、高品質データでのアニーリングを伴う統合学習、言語モデルの強化学習、フローマッチングのロバスト性訓練、そして最後の強化学習です。

制御は二系統あります。自由記述の自然言語指示と、86 個の細粒度インラインタグです。タグは語句や単語の単位で話し方を調整でき、笑い、呼吸、咳といった非言語イベントも指定できます。対応は 16 言語(今回 7 言語を追加)と 中国語の 20 方言地域。1 回の長文合成は最長 3 分、出力は最大 48 kHz で、雑音や残響のある参照音声でも別途ノイズ除去を挟まずに動きます。Alibaba は、独立系の Artificial Analysis 音声合成リーダーボードで 1 位だと述べています。

料金

以下は Qwen Cloud のモデルページで 2026-09-23 に確認した数値です。

モデル 入力 出力 レート制限
ASR-Flash-Filetrans $0.15 / 100万トークン $0.47 / 100万トークン 600 RPM
TTS-Flash $0.23 / 100万トークン $1.87 / 100万トークン 180 RPM
Realtime-Plus Qwen Cloud の料金ページを参照 Qwen Cloud の料金ページを参照 モデルページを参照

制限事項

  • 五つのうち二つは発表のみ。 ASR-Next と TTS-Next は確認時点で公開された API id も価格もなく、追加の API 提供は準備中とされています。
  • 今回の版にオープンウェイトはない。 3.1 の音声スタックはホスト型 API のみで、Alibaba が配布可能な音声ウェイトとして最後に公開したのは以前の Qwen-Omni 世代です。
  • 方言対応は中国語中心。 20 の方言地域はいずれも中国語で、それ以外は 16 言語の範囲に従います。
  • 首位の根拠はベンダー提供。 Artificial Analysis の順位は Alibaba の発表によるもので、選定時は自分の言語ペアで実際のボードを確認してください。

よくある質問

Qwen-Audio-3.1 はオープンソースですか?

いいえ。3.1 の音声スタックは Qwen Cloud のホスト型 API です。同価格帯のオープンウェイト音声合成を探すなら Breeze TTS 2 を参照してください。

ASR-Next は通常の ASR と何が違いますか?

話者ラベル、タイムスタンプ、整列テキストに加え、感情・環境音・機械音の理解があります。音のキャプション、イベントの位置特定、音声に対する質問応答に使えます。

ローカルで動かせますか?

このチェックポイントでは動きません。ローカル用途は sanoTTS が別系統で、パラメータ数 300 万未満のモデルをブラウザや ESP32 ボードで走らせる設計です。

代替案

  • Breeze TTS 2:参照音声なしの声設計に対応したオープンウェイト音声合成。
  • ElevenLabs Turbo v2.5:音声専業ベンダーのホスト型 TTS。
  • Deepgram Nova-2:対応言語の広いホスト型 ASR。
  • Qwen3.8-Omni-Flash:専用モデルを並べたくない場合に、音声・動画・テキストを一つのモデルで扱える全モーダル版。

コメント

まだコメントがありません。最初のコメントを投稿してください!