Qwen3.8-Omni-Flash logo

Qwen3.8-Omni-Flash

打开

Qwen3.8-Omni-Flash 是阿里的全模态智能体模型:100 万 token 上下文,原生输入文本、图像、音频与视频,每百万 token 仅 $0.15/$0.47。

分享:
查看替代方案

Qwen3.8-Omni-Flash

Qwen3.8-Omni-Flash 是千问团队第一个围绕智能体能力设计的原生全模态模型,2026-09-18 发布。它在同一个模型里接受文本、图像、音频与视频,上下文窗口 100 万 token,并且会先理解看到和听到的内容,再调用工具去执行。阿里给它的定位,是把过去要串几个 API 的流程压成一个模型:视频剪辑、MV 制作、影视解说、多媒体摘要、音视频对话。

模型规格

规格 Qwen3.8-Omni-Flash
上下文窗口 1,000,000 token
最大输入 991K token(思考模式 983K)
最大输出 131K token
最大推理预算 262K token
输入 文本、图像、音频、视频
输出 文本
架构 基于 Qwen3.8-Flash-Next 架构
吞吐 2M TPM、30K RPM
协议 兼容 DashScope 与 OpenAI 协议
许可 闭源权重

空间音频是这里的关键能力:模型支持双声道与四声道空间音频理解,这让多说话人的视频与对话分析真正可用,而不是拿到一坨重叠的文字。阿里同时开源了配套的 Qwen-MM-Plugins,方便智能体框架调用它的原生多模态能力,并预告 Qwen-Live Harness 即将发布。

定价

数据来自 Qwen Cloud 模型页,核对时间 2026-09-23。

项目 价格
输入 $0.15 / 百万 token
输出 $0.47 / 百万 token
隐式缓存读取 $0.016 / 百万 token

官方称视频输入成本相比 Qwen3.5-Omni-Plus 下降约 89%。如果你过去是「一个视频理解调用加一个文本模型调用」两笔账,这个数字才是真正省下来的部分。

官方公布的基准数据

以下数字来自官方发布,不是第三方独立复现:

  • 音视频智能体表现:在 WildClawBench-MM 与 UniClawBench 上平均提升 19.5 分。
  • 智能体式感知:在 OmniVideoBench 上比静态理解少用 51.8% 的 token,因为模型会主动探索长视频并定位关键片段,而不是逐帧看完。
  • 整体音视频能力:官方表述为「接近 Gemini 3.8 Flash」。

局限

  • 闭源权重。 Qwen3.8-Omni-Flash 只提供 API,没有可下载的 checkpoint。
  • 分数由厂商提供。 上面的提升幅度尚无独立复现,「接近 Gemini 3.8 Flash」是定位表述,不是实测排名。
  • 实际输入上限是 991K 而非 1M。 100 万是上下文窗口,真正的输入上限略低于它。
  • 用工具可能要装插件。 阿里推荐搭配 Qwen-MM-Plugins 才能让智能体框架充分调用多模态能力,裸接 API 不一定能拿到全部能力。

常见问题

Qwen3.8-Omni-Flash 和 Qwen-Audio-3.1 是一回事吗?

不是。Qwen-Audio-3.1 是转写、合成与实时语音方向的音频专用模型家族;Qwen3.8-Omni-Flash 是一个同时处理音频、视频、文本与图像的通用模型,而且会调用工具,不只是转写。

它会输出音频或图像吗?

不会。输入支持文本、图像、音频与视频,输出只有文本。需要图像生成可以看 Qwen-Image-2.1

和 Gemini 的全模态模型比怎么样?

阿里的说法是音视频任务上接近 Gemini 3.8 Flash。对照条目见 Google Gemini Omni Flash

替代方案

评论

还没有评论。成为第一个评论的人!