内容概览
本文围绕“千问发布 Qwen-Audio-3.1系列语音大模型,五款模型全线降价最高95%”整理核心信息、适用场景与使用条件,便于读者快速了解重点,再决定是否进一步体验或查阅项目资料。
详细信息
千问大模型9月23日发布 Qwen-Audio-3.1系列语音大模型,形成覆盖理解、生成、交互与创作的完整音频能力栈。系列包含语音识别 Qwen-Audio-3.1-ASR、音频理解 ASR-Next、语音合成 TTS、音频创作 TTS-Next 与实时交互 Realtime,API 已上架千问 AI 平台,ASR-Next API 即将上线。同期全线降价,TTS 降幅约70%,Realtime 约85%,ASR 达95%。

能力层面,ASR 增强多语种、方言识别与上下文理解,新增原生转写润色,可自动去除语气词与重复表达,并支持端到端分角色转写,联合输出说话人标签、时间戳与文本;一套模型支持30种语言和16种中文方言,流式识别首字响应约160毫秒。
ASR-Next 基于下代架构,把音频理解从语音中的文字扩展至情绪、环境声与机械声,支持声音描述、事件定位与音频问答推理。TTS 支持同音色跨语言自然迁移,并以指令控制情绪与语速。TTS-Next 面向音频创作,统一生成人声、音效与环境音,支持多角色音色复刻、细粒度时间戳与48kHz 输出,服务播客、有声书与影视游戏场景。Realtime 基于多教师蒸馏架构实现全双工交互,可随时插话打断,支持多语言实时切换、情绪理解与对话中调用工具。
实测方面,ASR 在开源方言测试集平均 CER4.55%,中文方言自建集平均 CER10.38%,方言转普通话平均语义句准率82.10%;ASR-Flash-Next 与 ASR-Flash 在四测试集八项指标中分获五项、三项最优,全面优于此前的 Fun-ASR 级联系统。
目前 Realtime 正与 Qoder、千问办公等 Agent 及千问 AI 眼镜等智能硬件结合,延续语音成为人机交互自然入口的趋势。
-
Qwen-Audio-3.1-ASR:
https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash
-
Qwen-Audio-3.1-TTS:
https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash
-
Qwen-Audio-3.1-TTS-Next:
https://www.qianwenai.com/models/qwen-audio-3.1-tts-next
-
Qwen-Audio-3.1-Realtime:
https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus
(Qwen-Audio-3.1-ASR-Next API即将上线)
编辑整理:阅读要点
- 功能和价格可能随版本或地区变化,使用前应查看最新说明。
- 安装软件或启用服务时,优先使用项目官方渠道并检查所需权限。
- 是否适合长期使用,应结合自身设备、工作流和实际体验判断。
