Qwen-Audio-3.1 logo

Qwen-Audio-3.1

打开

阿里 Qwen-Audio-3.1 语音栈新增 ASR-Next 与 TTS-Next,TTS 登顶 Artificial Analysis 语音合成榜,API 价格最高下调 95%。

分享:
查看替代方案

Qwen-Audio-3.1

Qwen-Audio-3.1 是阿里在 2026-09-23 通过官方账号发布的语音模型家族更新。它不是单个模型,而是一整套五个模型的语音栈:原有的 ASRTTSRealtime 升级,同时新增 ASR-Next(语音理解)和 TTS-Next(音频创作)。

对多数团队来说,最实际的信号是价格。官方宣布 TTS 降价约 70%、Realtime 降价约 85%、ASR 最高降价 95%。按分钟计费的语音业务,这次降幅直接改写成本结构。

语音栈包含哪些模型

模型 定位 Qwen Cloud 上的 API id
ASR 多语言与方言转写,原生润色会自动去掉口头语和重复内容 qwen-audio-3.1-asr-flash-filetrans
ASR-Next 支持说话人分离、时间戳、对齐文本的多说话人识别,并能理解情绪与环境音 已发布,API 即将上线
TTS 指令控制的语音合成,支持跨语言音色迁移 qwen-audio-3.1-tts-flash
TTS-Next 统一 LM 与扩散框架,一次性生成人声、音效与背景音 已发布,API 即将上线
Realtime 全双工实时语音,支持随时打断与共情式应答 qwen-audio-3.1-realtime-plus

TTS 模型详解

官方技术说明把 Qwen-Audio-3.1-TTS 定义为一套面向生产的语音合成系统:底层是 12.5 Hz 低帧率语音分词器,训练采用五阶段流程,分别是语言模型与流匹配模型各自预训练、用高质量数据退火做联合训练、语言模型强化学习、流匹配鲁棒性训练,以及最后一轮强化学习。

控制手段有两套:一套是自由风格的自然语言指令,另一套是 86 个细粒度行内标签,可以在词组和单词级别控制语气,还能触发笑、呼吸、咳嗽等非语言事件。语言覆盖 16 种语言(本次新增 7 种)与 20 个中文方言区。单次长文合成最长 3 分钟,输出最高 48 kHz,并且在嘈杂、混响或参考音频不清晰的条件下依然可用,不需要额外走一遍降噪。官方称该模型已在独立的 Artificial Analysis 语音合成榜上排名第一

定价

下表来自 Qwen Cloud 模型页,核对时间 2026-09-23。

模型 输入 输出 速率限制
ASR-Flash-Filetrans $0.15 / 百万 token $0.47 / 百万 token 600 RPM
TTS-Flash $0.23 / 百万 token $1.87 / 百万 token 180 RPM
Realtime-Plus 见 Qwen Cloud 定价页 见 Qwen Cloud 定价页 见模型页

局限

  • 五个模型里有两个只发布了公告。 ASR-Next 与 TTS-Next 在核对时还没有公开的 API id 与价格,官方称更多 API 正在开放中。
  • 本次没有开放权重。 3.1 语音栈目前只能通过托管 API 使用,阿里最后一批可下载的语音权重还停留在更早的 Qwen-Omni 一代。
  • 方言支持以中文为中心。 20 个方言区都指中文,其他语言覆盖仍以那 16 种为准。
  • 榜首结论来自厂商。 Artificial Analysis 的排名是阿里自己公布的,做选型时建议用你的语言组合去实测榜面对照。

常见问题

Qwen-Audio-3.1 是开源的吗?

不是。3.1 语音栈目前以 Qwen Cloud 托管 API 形式提供。如果想要同价位带的开源权重语音合成模型,可以看看 Breeze TTS 2

ASR-Next 相比普通 ASR 多了什么?

多了说话人标签、时间戳和对齐文本,并且能理解情绪、环境音与机器声,可用于声音描述、事件定位和音频问答。

能在本地跑吗?

这套 checkpoint 不行。本地方向可以看 sanoTTS,那是完全不同量级的产品,参数量不到 300 万,浏览器或 ESP32 开发板就能跑。

替代方案

评论

还没有评论。成为第一个评论的人!