Qwen-Audio-3.1
Qwen-Audio-3.1 是阿里在 2026-09-23 通过官方账号发布的语音模型家族更新。它不是单个模型,而是一整套五个模型的语音栈:原有的 ASR、TTS 与 Realtime 升级,同时新增 ASR-Next(语音理解)和 TTS-Next(音频创作)。
对多数团队来说,最实际的信号是价格。官方宣布 TTS 降价约 70%、Realtime 降价约 85%、ASR 最高降价 95%。按分钟计费的语音业务,这次降幅直接改写成本结构。
语音栈包含哪些模型
| 模型 | 定位 | Qwen Cloud 上的 API id |
|---|---|---|
| ASR | 多语言与方言转写,原生润色会自动去掉口头语和重复内容 | qwen-audio-3.1-asr-flash-filetrans |
| ASR-Next | 支持说话人分离、时间戳、对齐文本的多说话人识别,并能理解情绪与环境音 | 已发布,API 即将上线 |
| TTS | 指令控制的语音合成,支持跨语言音色迁移 | qwen-audio-3.1-tts-flash |
| TTS-Next | 统一 LM 与扩散框架,一次性生成人声、音效与背景音 | 已发布,API 即将上线 |
| Realtime | 全双工实时语音,支持随时打断与共情式应答 | qwen-audio-3.1-realtime-plus |
TTS 模型详解
官方技术说明把 Qwen-Audio-3.1-TTS 定义为一套面向生产的语音合成系统:底层是 12.5 Hz 低帧率语音分词器,训练采用五阶段流程,分别是语言模型与流匹配模型各自预训练、用高质量数据退火做联合训练、语言模型强化学习、流匹配鲁棒性训练,以及最后一轮强化学习。
控制手段有两套:一套是自由风格的自然语言指令,另一套是 86 个细粒度行内标签,可以在词组和单词级别控制语气,还能触发笑、呼吸、咳嗽等非语言事件。语言覆盖 16 种语言(本次新增 7 种)与 20 个中文方言区。单次长文合成最长 3 分钟,输出最高 48 kHz,并且在嘈杂、混响或参考音频不清晰的条件下依然可用,不需要额外走一遍降噪。官方称该模型已在独立的 Artificial Analysis 语音合成榜上排名第一。
定价
下表来自 Qwen Cloud 模型页,核对时间 2026-09-23。
| 模型 | 输入 | 输出 | 速率限制 |
|---|---|---|---|
| ASR-Flash-Filetrans | $0.15 / 百万 token | $0.47 / 百万 token | 600 RPM |
| TTS-Flash | $0.23 / 百万 token | $1.87 / 百万 token | 180 RPM |
| Realtime-Plus | 见 Qwen Cloud 定价页 | 见 Qwen Cloud 定价页 | 见模型页 |
局限
- 五个模型里有两个只发布了公告。 ASR-Next 与 TTS-Next 在核对时还没有公开的 API id 与价格,官方称更多 API 正在开放中。
- 本次没有开放权重。 3.1 语音栈目前只能通过托管 API 使用,阿里最后一批可下载的语音权重还停留在更早的 Qwen-Omni 一代。
- 方言支持以中文为中心。 20 个方言区都指中文,其他语言覆盖仍以那 16 种为准。
- 榜首结论来自厂商。 Artificial Analysis 的排名是阿里自己公布的,做选型时建议用你的语言组合去实测榜面对照。
常见问题
Qwen-Audio-3.1 是开源的吗?
不是。3.1 语音栈目前以 Qwen Cloud 托管 API 形式提供。如果想要同价位带的开源权重语音合成模型,可以看看 Breeze TTS 2。
ASR-Next 相比普通 ASR 多了什么?
多了说话人标签、时间戳和对齐文本,并且能理解情绪、环境音与机器声,可用于声音描述、事件定位和音频问答。
能在本地跑吗?
这套 checkpoint 不行。本地方向可以看 sanoTTS,那是完全不同量级的产品,参数量不到 300 万,浏览器或 ESP32 开发板就能跑。
替代方案
- Breeze TTS 2:开源权重、支持无参考音频的音色设计。
- ElevenLabs Turbo v2.5:专业语音厂商提供的托管 TTS。
- Deepgram Nova-2:覆盖语言广的托管 ASR。
- Qwen3.8-Omni-Flash:不想要一串专用模型时,可以用这个全模态模型把音频、视频与文本放进同一个模型里。
评论
还没有评论。成为第一个评论的人!
相关工具
相关洞察

Obsidian CLI + Codex:把笔记库变成 Agent 的知识引擎
Obsidian CLI 让 Codex、Claude Code、Gemini CLI 等 Agent 能以可搜索、可追踪、保留双链语义的方式读写本地 Vault。本文用真实社区案例和可复制工作流说明如何搭建。
GPT-6 Astra 没追上 Fable 5.1,追上的是账单
Artificial Analysis 智能指数上 Fable 5.1 66 分、Astra 61 分,Astra 没追上智力。但完成同一批任务的成本只要 Fable 5.1 的不到一半,真正收紧的是账单,不是脑子。

Grok Bot、Hermes Bot:一个人,终于配上了智囊团和秘书处
Grok Bot 进了 Cursor Pro+,Hermes Bot 能跑在 VPS 上。它们不是更聪明的聊天框。出主意的是智囊团,抓落实的是秘书处,拍板的还是你。