Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash は、Qwen チームが 2026-09-18 に発表した、エージェント能力を軸に設計された初のネイティブ全モーダルモデルです。テキスト、画像、音声、動画を一つのモデルで受け取り、100 万トークンの文脈を持ち、見たもの・聞いたものを理解したうえでツールを呼び出して実行します。Alibaba が想定するのは、以前なら複数の API をつなぐ必要があった作業です。動画編集、ミュージックビデオ制作、映像のナレーション、マルチメディア要約、音声と映像をまたぐ対話などが該当します。
モデル仕様
| 項目 | Qwen3.8-Omni-Flash |
|---|---|
| コンテキスト | 1,000,000 トークン |
| 最大入力 | 991K トークン(思考モードでは 983K) |
| 最大出力 | 131K トークン |
| 最大推論バジェット | 262K トークン |
| 入力 | テキスト、画像、音声、動画 |
| 出力 | テキスト |
| アーキテクチャ | Qwen3.8-Flash-Next アーキテクチャをベース |
| スループット | 2M TPM、30K RPM |
| プロトコル | DashScope と OpenAI 互換 |
| ライセンス | クローズドウェイト |
ここで重要なのが空間オーディオです。2 チャンネルと 4 チャンネルの空間音声理解に対応しており、複数話者の動画や対話の解析が、重なった文字列の山ではなく実用的な形で扱えます。Alibaba はエージェントフレームワークからネイティブなマルチモーダル能力を使うための Qwen-MM-Plugins もオープンソース化し、Qwen-Live Harness を準備中としています。
料金
Qwen Cloud のモデルページで 2026-09-23 に確認した数値です。
| 項目 | 価格 |
|---|---|
| 入力 | $0.15 / 100万トークン |
| 出力 | $0.47 / 100万トークン |
| 暗黙的キャッシュ読み取り | $0.016 / 100万トークン |
公式によると、動画入力のコストは Qwen3.5-Omni-Plus 比で約 89% 下がります。従来「動画理解の呼び出し+テキストモデルの呼び出し」の二重計上だった用途では、この差がそのまま効きます。
発表時のベンチマーク
以下は公式発表の数値で、第三者による再現ではありません。
- 音声・映像エージェント性能:WildClawBench-MM と UniClawBench で平均 19.5 ポイント向上。
- エージェント的知覚:OmniVideoBench で静的理解より 51.8% 少ないトークン。全フレームを読むのではなく、長い動画を能動的に探索して要点を特定します。
- 音声・映像の総合力:公式の表現は「Gemini 3.8 Flash に迫る」です。
制限事項
- クローズドウェイト。 Qwen3.8-Omni-Flash は API のみで、ダウンロード可能なチェックポイントはありません。
- スコアはベンダー提供。 上記の改善幅は独立に再現されておらず、「Gemini 3.8 Flash に迫る」は位置づけの主張で測定された順位ではありません。
- 実効入力は 1M ではなく 991K。 100 万はコンテキストであり、実際の入力上限はそのわずか下です。
- ツール利用にはプラグインが要る場合がある。 エージェントフレームワークから全能力を引き出すには Qwen-MM-Plugins が推奨され、素の API 接続ではすべては使えません。
よくある質問
Qwen3.8-Omni-Flash と Qwen-Audio-3.1 は同じですか?
違います。Qwen-Audio-3.1 は文字起こし・合成・リアルタイム音声に特化した音声モデル群です。Qwen3.8-Omni-Flash は音声・動画・テキスト・画像をまとめて扱い、文字起こしだけでなくツールを呼び出す汎用モデルです。
音声や画像を出力しますか?
しません。入力はテキスト、画像、音声、動画ですが、出力はテキストのみです。画像生成は Qwen-Image-2.1 を参照してください。
Gemini の全モーダルモデルと比べてどうですか?
Alibaba の主張は、音声・映像タスクで Gemini 3.8 Flash に迫るというものです。比較対象は Google Gemini Omni Flash を参照してください。
代替案
- Qwen3.8-Flash-Next:ベースとなったテキスト重視のアーキテクチャ。音声や動画が不要ならこちらが有利です。
- Google Gemini Omni Flash:同帯の Google の全モーダル製品。
- Qwen-Image-2.1:不足しているのが理解ではなく画像の生成・編集である場合。
- Qwen-Audio-3.1:音声だけが目的なら専用モデルの方が適しています。
コメント
まだコメントがありません。最初のコメントを投稿してください!
関連ツール
関連インサイト

Anthropic Subagent: マルチエージェント時代のアーキテクチャ革命
Anthropicのマルチエージェントアーキテクチャ設計を徹底解説。Subagentによるコンテキストウィンドウ制限の突破、90%のパフォーマンス向上、Claude Codeでの実際の応用について学びます。
Claude Skills 完全ガイド - 必須10大 Skills 徹底解説
Claude Skills の拡張メカニズムを深掘りし、10の中核スキルと Obsidian 連携を詳しく解説。高効率な AI ワークフロー構築を支援します
AI アシスタントをチャットボックスに押し込むな:Clawdbot は戦場を間違えた
Clawdbot は便利だが、Slack や Discord に入れて操作するのは最初から間違った設計だ。チャットツールはタスク操作のためのものではなく、AI もおしゃべりのためではない。