Qwen-Audio-3.0-TTS 发布:多语种实时语音合成新标杆,权威评测夺冠

2026-07-20 16:59:21
来源:AI观察
分享
AIME

问财摘要

1、通义千问团队发布了Qwen-Audio-3.0-TTS实时语音合成模型,包括面向实时交互的Flash版和面向高质量生成的Plus版。Plus版在全球第三方权威榜单ArtificialAnalysis中获得了冠军。 2、新模型解决了多语言覆盖、自然指令控制、精细标签控制及复杂环境下音色复刻四大生产难题。 3、模型支持20种高质量方言,通过专项训练有效缓解了方言特色弱化问题,使合成语音更接近母语者。 4、模型支持Free-style自然语言指令控制,用户无需专业知识即可通过自然语言定义情绪、角色、场景和语速。 5、模型通过真实声学仿真训练增强了抗干扰能力,能在高混响、高噪声场景下有效过滤干扰并保留音色。
免责声明 内容由AI生成
文章提及标的

据通义实验室消息,通义千问团队正式发布 Qwen-Audio-3.0-TTS 实时语音合成模型,推出面向实时交互的 Flash 版和面向高质量生成的 Plus 版。其中,Plus 版在全球第三方权威榜单 Artificial Analysis 中斩获冠军。新模型重点解决了多语言覆盖、自然指令控制、精细标签控制及复杂环境下音色复刻四大生产难题。

能力总览

Qwen-Audio-3.0-TTS 的核心能力矩阵聚焦于多语种与方言、自由指令、细粒度控制和声学鲁棒性四大方向。

多语种与方言全面升级

模型覆盖中文、英文、日语、韩语、德语等 16 种语言。在 CV3-Eval 多语言评测集上,Flash 版和 Plus 版的平均词/字错误率(WER/CER)分别为 3.87 和 3.96,整体可懂度领先。说话人相似度方面,Plus 版在所有 16 种语言中均排名第一,平均得分达 82.75,Flash 版以 80.44 紧随其后,展现出稳定的音色还原能力。此外,模型支持 20 种高质量方言,通过专项训练有效缓解了方言特色弱化问题,使合成语音更接近母语者。

Free-style 自由指令与细粒度标签控制

模型支持 Free-style 自然语言指令控制,用户无需专业知识即可通过自然语言定义情绪、角色、场景和语速。同时,模型支持在文本中直接嵌入结构化标签,如 [gasp]、[giggles]、[angry],实现对语气、情绪和呼吸细节的精准调控,适合叙事、游戏(881275)、影视配音等场景。

复杂声学鲁棒性与精品音色库

针对真实业务中参考音频常存在噪声的问题,模型通过真实声学仿真训练增强了抗干扰能力,能在高混响、高噪声场景下有效过滤干扰并保留音色。配套的精品音色库覆盖指令风格、20 种方言、细粒度控制及 14 款以上小语种音色。音频输出品质提升至 48kHz,单次合成支持长达 3 分钟。其中,48K 高清音频输出功能预计于 7 月 24 日正式开放。模型现已全面开放接入。

原文:从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布(来源:通义实验室)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME