通义千问发布语音合成大模型Qwen-Audio-3.0-TTS,AI声音实现从“说话”到“表演”的跨越

2026-07-20 16:59:21
来源:AI观察
分享
AIME

问财摘要

1、通义千问推出语音合成大模型Qwen-Audio-3.0-TTS,包含实时交互的Flash版本和高质量生成的Plus版本。新模型在细粒度标签控制、自然语言指令遵循、多语种与方言覆盖等方面实现系统性提升,并在全球权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斩获冠军。 2、核心升级亮点包括细粒度标签控制、自由指令控制、多语种精准合成能力全面升级、中文方言合成正宗度显著提升、复杂声学场景鲁棒性等。
免责声明 内容由AI生成
文章提及标的

据千问大模型消息,通义千问正式推出语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本和面向高质量生成的Plus版本。新模型在细粒度标签控制、自然语言指令遵循、多语种与方言覆盖等方面实现系统性提升,并在全球权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斩获冠军。

核心升级亮点如下:

细粒度标签控制:精确到呼吸和情绪

模型支持在文本中嵌入[gasp]、[giggles]、[angry]等结构化标签,可精准调控语气、情绪和呼吸等非语言细节,特别适合叙事、游戏(881275)、影视配音等场景。配套的音色库将陆续上架指令风格、20种方言、细粒度控制及14种以上小语种音色,音频输出规格也从24KHz提升至48KHz,单次合成时长可达3分钟。

自由指令控制:用自然语言定义声音风格

用户可直接用自然语言描述角色、情绪、场景和语速,无需专业知识即可灵活定义声音风格。例如,可指令模型以“年轻女性小学老师”的身份,用缓慢语速和上扬语调进行教学示范。

多语种精准合成能力全面升级

Qwen-Audio-3.0-TTS-Plus专项优化了16种语言的合成,新增阿拉伯语、越南语、马来语、菲律宾语。在16种语言的“词/字错误率”评测中,模型家族在10种语言上取得SOTA,韩语和马来语领先幅度最大;在“说话人相似度”评测中,Plus版本包揽全部最优,Flash版本则获得15项第二。

中文方言合成正宗度显著提升

模型支持广东话、重庆话、东北话、上海话等20种方言,通过更高质量的数据和专门的方言强化训练,有效缓解了方言特色弱化问题,使韵律、声调和口语表达更接近母语者。

复杂声学场景鲁棒性

通过真实声学仿真训练,模型将语音增强能力原生嵌入克隆流程,即使参考音频存在背景杂音或高混响,也能过滤干扰、保留纯净音色。

原文:Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演(来源:千问大模型)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME