Qwen3.8-Omni-Flash logo

Qwen3.8-Omni-Flash

開く

Qwen3.8-Omni-Flash は Alibaba の全モーダル・エージェントモデル。100 万トークン文脈、テキスト・画像・音声・動画入力、100万トークンあたり $0.15/$0.47。

共有:
代替ツールを見る

Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash は、Qwen チームが 2026-09-18 に発表した、エージェント能力を軸に設計された初のネイティブ全モーダルモデルです。テキスト、画像、音声、動画を一つのモデルで受け取り、100 万トークンの文脈を持ち、見たもの・聞いたものを理解したうえでツールを呼び出して実行します。Alibaba が想定するのは、以前なら複数の API をつなぐ必要があった作業です。動画編集、ミュージックビデオ制作、映像のナレーション、マルチメディア要約、音声と映像をまたぐ対話などが該当します。

モデル仕様

項目 Qwen3.8-Omni-Flash
コンテキスト 1,000,000 トークン
最大入力 991K トークン(思考モードでは 983K)
最大出力 131K トークン
最大推論バジェット 262K トークン
入力 テキスト、画像、音声、動画
出力 テキスト
アーキテクチャ Qwen3.8-Flash-Next アーキテクチャをベース
スループット 2M TPM、30K RPM
プロトコル DashScope と OpenAI 互換
ライセンス クローズドウェイト

ここで重要なのが空間オーディオです。2 チャンネルと 4 チャンネルの空間音声理解に対応しており、複数話者の動画や対話の解析が、重なった文字列の山ではなく実用的な形で扱えます。Alibaba はエージェントフレームワークからネイティブなマルチモーダル能力を使うための Qwen-MM-Plugins もオープンソース化し、Qwen-Live Harness を準備中としています。

料金

Qwen Cloud のモデルページで 2026-09-23 に確認した数値です。

項目 価格
入力 $0.15 / 100万トークン
出力 $0.47 / 100万トークン
暗黙的キャッシュ読み取り $0.016 / 100万トークン

公式によると、動画入力のコストは Qwen3.5-Omni-Plus 比で約 89% 下がります。従来「動画理解の呼び出し+テキストモデルの呼び出し」の二重計上だった用途では、この差がそのまま効きます。

発表時のベンチマーク

以下は公式発表の数値で、第三者による再現ではありません。

  • 音声・映像エージェント性能:WildClawBench-MM と UniClawBench で平均 19.5 ポイント向上。
  • エージェント的知覚:OmniVideoBench で静的理解より 51.8% 少ないトークン。全フレームを読むのではなく、長い動画を能動的に探索して要点を特定します。
  • 音声・映像の総合力:公式の表現は「Gemini 3.8 Flash に迫る」です。

制限事項

  • クローズドウェイト。 Qwen3.8-Omni-Flash は API のみで、ダウンロード可能なチェックポイントはありません。
  • スコアはベンダー提供。 上記の改善幅は独立に再現されておらず、「Gemini 3.8 Flash に迫る」は位置づけの主張で測定された順位ではありません。
  • 実効入力は 1M ではなく 991K。 100 万はコンテキストであり、実際の入力上限はそのわずか下です。
  • ツール利用にはプラグインが要る場合がある。 エージェントフレームワークから全能力を引き出すには Qwen-MM-Plugins が推奨され、素の API 接続ではすべては使えません。

よくある質問

Qwen3.8-Omni-Flash と Qwen-Audio-3.1 は同じですか?

違います。Qwen-Audio-3.1 は文字起こし・合成・リアルタイム音声に特化した音声モデル群です。Qwen3.8-Omni-Flash は音声・動画・テキスト・画像をまとめて扱い、文字起こしだけでなくツールを呼び出す汎用モデルです。

音声や画像を出力しますか?

しません。入力はテキスト、画像、音声、動画ですが、出力はテキストのみです。画像生成は Qwen-Image-2.1 を参照してください。

Gemini の全モーダルモデルと比べてどうですか?

Alibaba の主張は、音声・映像タスクで Gemini 3.8 Flash に迫るというものです。比較対象は Google Gemini Omni Flash を参照してください。

代替案

  • Qwen3.8-Flash-Next:ベースとなったテキスト重視のアーキテクチャ。音声や動画が不要ならこちらが有利です。
  • Google Gemini Omni Flash:同帯の Google の全モーダル製品。
  • Qwen-Image-2.1:不足しているのが理解ではなく画像の生成・編集である場合。
  • Qwen-Audio-3.1:音声だけが目的なら専用モデルの方が適しています。

コメント

まだコメントがありません。最初のコメントを投稿してください!