据千问大模型消息,通义千问正式推出语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本和面向高质量生成的Plus版本。新模型在细粒度标签控制、自然语言指令遵循、多语种与方言覆盖等方面实现系统性提升,并在全球权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斩获冠军。
核心升级亮点如下:
细粒度标签控制:精确到呼吸和情绪
模型支持在文本中嵌入[gasp]、[giggles]、[angry]等结构化标签,可精准调控语气、情绪和呼吸等非语言细节,特别适合叙事、游戏(881275)、影视配音等场景。配套的音色库将陆续上架指令风格、20种方言、细粒度控制及14种以上小语种音色,音频输出规格也从24KHz提升至48KHz,单次合成时长可达3分钟。
自由指令控制:用自然语言定义声音风格
用户可直接用自然语言描述角色、情绪、场景和语速,无需专业知识即可灵活定义声音风格。例如,可指令模型以“年轻女性小学老师”的身份,用缓慢语速和上扬语调进行教学示范。
多语种精准合成能力全面升级
Qwen-Audio-3.0-TTS-Plus专项优化了16种语言的合成,新增阿拉伯语、越南语、马来语、菲律宾语。在16种语言的“词/字错误率”评测中,模型家族在10种语言上取得SOTA,韩语和马来语领先幅度最大;在“说话人相似度”评测中,Plus版本包揽全部最优,Flash版本则获得15项第二。
中文方言合成正宗度显著提升
模型支持广东话、重庆话、东北话、上海话等20种方言,通过更高质量的数据和专门的方言强化训练,有效缓解了方言特色弱化问题,使韵律、声调和口语表达更接近母语者。
复杂声学场景鲁棒性
通过真实声学仿真训练,模型将语音增强能力原生嵌入克隆流程,即使参考音频存在背景杂音或高混响,也能过滤干扰、保留纯净音色。
原文:Qwen-Audio-3.0-TTS 发布:当 AI 声音开始学会表演(来源:千问大模型)
