Qwen3.8-Omni-Flash
Qwen3.8-Omni-Flash 是千问团队第一个围绕智能体能力设计的原生全模态模型,2026-09-18 发布。它在同一个模型里接受文本、图像、音频与视频,上下文窗口 100 万 token,并且会先理解看到和听到的内容,再调用工具去执行。阿里给它的定位,是把过去要串几个 API 的流程压成一个模型:视频剪辑、MV 制作、影视解说、多媒体摘要、音视频对话。
模型规格
| 规格 | Qwen3.8-Omni-Flash |
|---|---|
| 上下文窗口 | 1,000,000 token |
| 最大输入 | 991K token(思考模式 983K) |
| 最大输出 | 131K token |
| 最大推理预算 | 262K token |
| 输入 | 文本、图像、音频、视频 |
| 输出 | 文本 |
| 架构 | 基于 Qwen3.8-Flash-Next 架构 |
| 吞吐 | 2M TPM、30K RPM |
| 协议 | 兼容 DashScope 与 OpenAI 协议 |
| 许可 | 闭源权重 |
空间音频是这里的关键能力:模型支持双声道与四声道空间音频理解,这让多说话人的视频与对话分析真正可用,而不是拿到一坨重叠的文字。阿里同时开源了配套的 Qwen-MM-Plugins,方便智能体框架调用它的原生多模态能力,并预告 Qwen-Live Harness 即将发布。
定价
数据来自 Qwen Cloud 模型页,核对时间 2026-09-23。
| 项目 | 价格 |
|---|---|
| 输入 | $0.15 / 百万 token |
| 输出 | $0.47 / 百万 token |
| 隐式缓存读取 | $0.016 / 百万 token |
官方称视频输入成本相比 Qwen3.5-Omni-Plus 下降约 89%。如果你过去是「一个视频理解调用加一个文本模型调用」两笔账,这个数字才是真正省下来的部分。
官方公布的基准数据
以下数字来自官方发布,不是第三方独立复现:
- 音视频智能体表现:在 WildClawBench-MM 与 UniClawBench 上平均提升 19.5 分。
- 智能体式感知:在 OmniVideoBench 上比静态理解少用 51.8% 的 token,因为模型会主动探索长视频并定位关键片段,而不是逐帧看完。
- 整体音视频能力:官方表述为「接近 Gemini 3.8 Flash」。
局限
- 闭源权重。 Qwen3.8-Omni-Flash 只提供 API,没有可下载的 checkpoint。
- 分数由厂商提供。 上面的提升幅度尚无独立复现,「接近 Gemini 3.8 Flash」是定位表述,不是实测排名。
- 实际输入上限是 991K 而非 1M。 100 万是上下文窗口,真正的输入上限略低于它。
- 用工具可能要装插件。 阿里推荐搭配 Qwen-MM-Plugins 才能让智能体框架充分调用多模态能力,裸接 API 不一定能拿到全部能力。
常见问题
Qwen3.8-Omni-Flash 和 Qwen-Audio-3.1 是一回事吗?
不是。Qwen-Audio-3.1 是转写、合成与实时语音方向的音频专用模型家族;Qwen3.8-Omni-Flash 是一个同时处理音频、视频、文本与图像的通用模型,而且会调用工具,不只是转写。
它会输出音频或图像吗?
不会。输入支持文本、图像、音频与视频,输出只有文本。需要图像生成可以看 Qwen-Image-2.1。
和 Gemini 的全模态模型比怎么样?
阿里的说法是音视频任务上接近 Gemini 3.8 Flash。对照条目见 Google Gemini Omni Flash。
替代方案
- Qwen3.8-Flash-Next:它基于的文本优先架构,不需要音视频时更划算。
- Google Gemini Omni Flash:同档位的 Google 全模态产品。
- Qwen-Image-2.1:缺口在图像生成与编辑而不是理解时。
- Qwen-Audio-3.1:只做语音时用音频专用模型更合适。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Anthropic Subagent:多智能体时代的架构革命
深入解析 Anthropic 的多智能体架构设计。了解如何通过 Subagent 突破上下文窗口限制,实现性能提升 90%,以及多智能体系统在 Claude Code 中的实际应用。
别再把 AI 助手塞进聊天框了:Clawdbot 选错了战场
Clawdbot 很方便,但将它放在 Slack 或 Discord 里操控,是从一开始就错的设计选择。聊天工具不是用来操作任务的,AI 也不是用来聊天的。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。