据通义实验室消息,通义千问团队正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型,推出面向实时交互的 Flash 版和面向高质量生成的 Plus 版。其中,Plus 版在全球第三方权威榜单 Artificial Analysis 中斩获冠军。新模型重点解决了多语言覆盖、自然指令控制、精细标签控制及复杂环境下音色复刻四大生产难题。
能力总览
Qwen-Audio-3.0-TTS 的核心能力矩阵聚焦于多语种与方言、自由指令、细粒度控制和声学鲁棒性四大方向。
多语种与方言全面升级
模型覆盖中文、英文、日语、韩语、德语等 16 种语言。在 CV3-Eval 多语言评测集上,Flash 版和 Plus 版的平均词/字错误率(WER/CER)分别为 3.87 和 3.96,整体可懂度领先。说话人相似度方面,Plus 版在所有 16 种语言中均排名第一,平均得分达 82.75,Flash 版以 80.44 紧随其后,展现出稳定的音色还原能力。此外,模型支持 20 种高质量方言,通过专项训练有效缓解了方言特色弱化问题,使合成语音更接近母语者。
Free-style 自由指令与细粒度标签控制
模型支持 Free-style 自然语言指令控制,用户无需专业知识即可通过自然语言定义情绪、角色、场景和语速。同时,模型支持在文本中直接嵌入结构化标签,如 [gasp]、[giggles]、[angry],实现对语气、情绪和呼吸细节的精准调控,适合叙事、游戏(881275)、影视配音等场景。
复杂声学鲁棒性与精品音色库
针对真实业务中参考音频常存在噪声的问题,模型通过真实声学仿真训练增强了抗干扰能力,能在高混响、高噪声场景下有效过滤干扰并保留音色。配套的精品音色库覆盖指令风格、20 种方言、细粒度控制及 14 款以上小语种音色。音频输出品质提升至 48kHz,单次合成支持长达 3 分钟。其中,48K 高清音频输出功能预计于 7 月 24 日正式开放。模型现已全面开放接入。
原文:从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布(来源:通义实验室)
