Qwen-Audio-3.1 五款语音模型齐发:能力、价格、开源 Agent 框架一篇说清
2026 年 9 月 23 日,千问在云栖大会上发布了 Qwen-Audio-3.1 系列语音大模型。这次不是单个模型迭代,而是一次放出五款——语音识别、语音合成、实时交互各有一个主力型号,另外新增一个音频理解模型和一个音频创作模型,官方称之为覆盖"理解—生成—交互—创作"的完整音频能力栈。
同时全线降价,ASR 最高降幅 95%。但这里有个容易被标题盖过的细节:这次降价伴随了一次计费单位变更,账面降幅和你的实际账单不是一回事,后面会细说。
还有一件事对开发者可能比模型本身更重要:千问开源了一个实时语音 Agent 框架 Qwen-Audio-Agent,Apache-2.0 许可。
五款模型分别管什么
1. Qwen-Audio-3.1-ASR:把转写变成能直接用的稿子
- 覆盖范围:一套模型支持 30 种语言和 16 种中文方言
- 速度:支持低延迟流式识别,边说边转写,首字响应约 160 毫秒
- 原生润色:自动去掉语气词、重复表达和自我纠正,再重组语义,输出更接近成稿
- 分角色转写:端到端把说话人标签、时间戳和文本联合输出,还能保留短插话和重叠语音
- 术语一致性:支持行业词、专业实体和分级热词,并能参考长音频的历史上下文,让人名、缩写和专业术语前后一致
官方给出的评测数字:在 KeSpeech 和 WSYue 的 11 个方言子集上平均 CER 4.55%,其中 6 个子集最优;在自建的中文方言测试集上平均 CER 10.38%,11 个方言子集最优,温州话这类难懂方言提升明显;方言转普通话的 AST 平均语义句准率 82.10%。分角色评测中,Flash-Next 和 Flash 在四个测试集共八项指标里分别拿下五项和三项最优,官方称全面优于此前的 Fun-ASR 级联方案。
但官方文档里有两个硬限制要看清楚:这个模型的上下文长度是 8192 Token,最大输入 7168 Token、最大输出 1024 Token,定位是短语音识别;长音频要走 filetrans 那个版本。
2. Qwen-Audio-3.1-ASR-Next:从"听懂话"到"听懂声音"
这款基于下代架构,换掉了处理对象——不再是"语音里的文字",而是"完整的音频信息"。
- 能理解人物情绪、环境声和机械声
- 能做声音描述、事件定位、音频问答与推理
- 官方举的例子是"这段录音中人的情绪怎样"这类问题
注意:发布时这款的 API 还没有上线,官方说法是即将推出。别急着排期。
3. Qwen-Audio-3.1-TTS:同一副嗓子说几种语言
- 多语种、多方言合成,核心差异点是同一音色跨语言自然迁移——录一遍中文音色,能直接生成英文、日文或粤语
- 支持 free-style 指令遵循和细粒度标签控制,可以用指令调情绪、语气、角色、语速、音量
- 做声音复刻时,对含噪声、混响的参考音频鲁棒性更强,不必先跑一遍降噪
- Flash 版本主打低延迟,支持流式合成
4. Qwen-Audio-3.1-TTS-Next:一次生成一整段声景
这是本次最有辨识度的一款。官方把它定义为 Audiogen 模型,不再是"把文字读出来",而是围绕文本、时间戳和参考音频,一次生成人声、音效和环境音。适用任务包括多语种 TTS、单人说话、多人对话、播客、影视剧声景、环境音与音效。
官方文档给的参数很具体,做方案时可以直接照着排:
- 最大输入 3000 字符
- 单次生成音频时长上限:播客 240 秒(4 分钟),其他场景 120 秒
- 参考音频最多 3 条,单条最长 30 秒、不超过 10 MB,格式限 WAV / MP3 / OGG Opus,不支持裸 PCM
- 输出最高 48kHz,格式 WAV / MP3 / PCM,非流式
- 目前只支持中文和英文
5. Qwen-Audio-3.1-Realtime:能同时说和听
- 全双工:说和听同时进行,用户可随时插话、打断
- 共情:识别到用户语气低落时,不机械回复"我理解你的感受",而是放慢语速、换更贴合语境的措辞
- 能办事:对话中可调用工具,连接 API、知识库和业务系统完成任务
- 基于多教师蒸馏架构,官方称在保持低延迟的同时增强事实可靠性与安全边界
- 已接入 Qoder、Qwen Office 等 Agent,以及千问 AI 眼镜这类硬件
官方模型 qwen-audio-3.1-realtime-plus 的规格:上下文 262,144 Token,最大输入 245,760,最大输出 16,384;默认音色 longanqian_v3.1;支持工具调用、联网搜索和声音复刻。
但有一个必须知道的限制:联网搜索(enable_search)不能和 Function Calling 同时启用。如果你的 Agent 既要查资料又要调工具,架构上得提前安排。
顺带开源的 Qwen-Audio-Agent,可能是更实用的那部分
千问这次开源了面向实时语音 Agent 的框架 Qwen-Audio-Agent,仓库为 QwenAudio/qwen-audio-agent,Apache-2.0 许可。
截至 2026 年 9 月 29 日,该仓库有 2815 个 star、277 个 fork,2026 年 7 月 27 日建仓,最近一次推送是 9 月 28 日,仍在活跃维护(数据取自 GitHub 官方接口)。
它解决的问题很具体:以前你用语音让 Agent 去查资料或改文件,话说完了,接下来是漫长的安静——任务没结束,话也聊不下去。这个框架把前台对话和后台任务拆成两条可以并行的链路:能直接答的立刻答,需要工具或长时间处理的交给后台 Agent,执行过程中还能追问进度、追加约束、取消任务,完成后结果自动回到当前对话。
它不替代你现有的 Agent,而是复用你已经配好的模型、工具、MCP、Skill 和认证。可接入的后台 Agent 包括:
- 原生 ACP:Qwen Code、OpenCode、OpenClaw、Qoder、MiniMax Code、Kimi Code、Hermes、CodeBuddy、DeepSeek Harness
- 外部 ACP 适配:Codex、Claude Code、Pi
语音前台也可以换。官方列出的选项有 Qwen Audio Realtime、OpenAI Realtime / GPT-Live、Google Gemini Live、Qwen3.5-Omni Realtime、Qwen3.8 Omni Flash Realtime、豆包 Seeduplex 3.0 Realtime、StepAudio 3 Realtime,以及可以本地部署的 Hugging Face Speech-to-Speech 和 MiniCPM-o 4.5。交互端提供浏览器 WebUI、终端 TUI 和桌面悬浮球(macOS / Windows / Linux)。
官方还放出了技术报告,arXiv 编号 2609.25195。
价格:看懂降幅之前,先看懂计费单位变了
官方口径是全线降价:TTS 约 70%、Realtime 约 85%、ASR 最高 95%。但这里有个容易忽略的点——ASR 从"按音频秒数计费"改成了"按 Token 计费"。单位换了,百分比是在两把不同的尺子上量的,不能直接当成账单降幅。
阿里云百炼官方页面上的现价(北京地域,原价,不含活动优惠):
- qwen-audio-3.1-asr-flash:输入 0.8 元 / 百万 Token,输出 2.7 元 / 百万 Token
- qwen-audio-3.1-tts-flash:输入 1.5 元 / 百万 Token,输出 12 元 / 百万 Token
- qwen-audio-3.1-tts-next:输入 6 元 / 百万 Token,输出 12 元 / 百万 Token
- qwen-audio-3.1-realtime-plus:文本输入 5 元、音频输入 40 元、文本输出 40 元、音频输出 150 元(均为每百万 Token)
换算时的关键一点:音频的 Token 消耗基本按固定速率折算(社区普遍引用的换算是一秒音频约 25 个 Token),所以输入侧可预测,输出侧不可预测——四个人密集发言的技术讨论,输出 Token 会远高于一问一答夹长停顿的访谈。想估算成本,拿你自己最"密"的那段音频跑一遍,别拿平均样本线性外推。
免费额度方面,只有华北 2(北京)地域的部分模型有,其他地域没有;ASR 相关额度一般是 10 小时 / 90 天。具体以百炼控制台为准。
上手三步
只想调模型 API 的话,去阿里云百炼开通、拿 API Key 就能用,模型 ID 就是上面列的那几个。
想体验"边聊边干活"的实时语音 Agent,走开源框架这条路:
- 确认环境:Node.js 22.22.2+ 或 24.15.0+,npm 10+
- 全局安装:
npm install -g qwen-audio-agent - 先跑
qwenaudio config生成配置并填入DASHSCOPE_API_KEY;然后一个终端跑qwenaudio启动 Gateway,另一个终端跑qwenaudio tui,或者用qwenaudio webui打开浏览器界面
配置里的 AGENT_PROTOCOL 决定后台接哪个 Agent,不设置或设为 none 就是纯前台模式——只聊天,不干活。
几个容易踩的坑
- 模型权重没有开源。本次开源的是 Agent 框架,五款模型都走 API。据第三方模型数据库和社区检索,Hugging Face 上目前没有 Qwen-Audio-3.1 系列的官方权重仓库,能看到的 Qwen/Qwen-Audio 属于上一代。另外别把它和开源的 Qwen3-ASR 轻量权重(0.6B / 1.7B)混为一谈,那是另一条独立产品线。想本地部署的话,短期内等不到。
- ASR-Next 的 API 发布时未上线,官方说的是即将推出。
- Realtime Plus 的联网搜索和 Function Calling 互斥,这是官方文档明写的。
- TTS-Next 只支持中英文,且有 3000 字符输入上限和生成时长上限,而且是非流式的,不适合实时对话。
- 限流不高:ASR-flash 的 RPM 是 600,TTS-flash 和 TTS-next 的 RPS 只有 3,Realtime Plus 是 RPM 60 / TPM 100,000。做压测或批量任务前先对一下。
- 开源框架的默认语音前台仍是 3.0。仓库配置示例里默认写的是 qwen-audio-3.0-realtime-plus,要用 3.1 得自己改配置项。
- 平台差异:macOS 桌面版默认支持带回声消除的全双工对话;Linux 和 Windows 的 TUI 默认是半双工模式。
一句话总结
Qwen-Audio-3.1 的价值不在于某一个模型变强了,而在于把语音这条链路拆成了可组合的标准件——识别、理解、合成、创作、实时交互各有专门的入口,再配一个开源的编排框架把它们串起来。对做语音产品的团队来说,这是"接口齐了、成本降了一个数量级"的时刻;但真正的成本精算,还得跑你自己的音频样本。
参考来源
- 阿里云百炼(Model Studio)官方模型文档:qwen-audio-3.1-asr-flash、qwen-audio-3.1-tts-flash、qwen-audio-3.1-tts-next、qwen-audio-3.1-realtime-plus 四个模型页——价格、上下文限制、限流、能力支持项均以此为准
- 千问 Qwen-Audio-3.1 官方发布材料:五款模型的定位、评测数据与降价幅度(经 IT之家、凤凰网科技、上海证券报等媒体转载)
- GitHub 仓库 QwenAudio/qwen-audio-agent 及其中文 README:star / fork / 许可证 / 提交时间取自 GitHub 官方 API
- 第三方整理(非官方口径,仅供估算参考):模型权重的开源状态、音频 Token 换算速率
说明:本文为介绍与解读,未在本地实测。所有参数与价格均引自阿里云百炼官方模型文档和官方发布材料;标注"第三方整理"的部分请以官方页面为准。价格与活动随时可能调整,正式采购前请核对百炼控制台。

