据千问大模型消息,全新的同声传译大模型Qwen3.8-LiveTranslate正式发布。模型采用Interleave架构,围绕实时翻译的准确度、流畅度和简洁度进行优化,字均延迟(LAAL)由上一代的2.8秒降至2.3秒,并新增实时说话人分离、原文译文同帧同出、长上下文消歧三项能力。
Qwen3.8-LiveTranslate支持60种语言,能够在多人交流中区分说话人及其发言内容,并更稳定地保留发言人的音色;原文和译文可同步呈现,便于即时理解、原文核对以及字幕展示、内容整理和检索;模型还可结合前文和历史语境,降低人名、术语和指代等翻译歧义。
核心亮点
Interleave架构:模型将同传重构为音频与文本交织的单流形式,已听音频和已输出译文均可缓存复用,在提升翻译质量的同时降低延迟。
实时说话人分离:在多人交替发言时,模型能够区分不同说话人及其发言内容,并帮助译文语音更准确、稳定地保留原说话人的音色。
原文译文同帧同出:同传过程中实现双语同步对齐,为即时理解、原文核对及字幕、内容整理和检索等应用提供基础。
长上下文消歧:模型结合前文和历史语境理解当前内容,减少仅依据单句判断专有名词和指代带来的歧义,提升表达一致性。
模型架构方面,Qwen3.8-LiveTranslate采用基于Hybrid MoE的Thinker–Talker双模块设计,通过Interleave衔接流式理解、文本输出和语音生成。Thinker将视频、音频、原文与译文按时序交织在同一条因果序列中,实现理解与翻译的端到端处理;Talker结合译文和源音频,合成保留原说话人音色的译文语音。
模型效果方面,在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度和说话人分离错误率(DER)四个维度均优于目前行业主流实时同传系统。在公开FLEURS音频测试集的70个语言方向评测中,模型在翻译质量、字均延迟、语音识别准确率和语音合成质量四个维度领先于上一代及当前主流实时同传系统。
目前,用户可通过https://omni.qwen.ai/live-translate体验,模型API已上线千问AI平台。
未来方向
1. 逼近同传延迟极限,持续压缩端到端时延,缩短“听到”与“译出”之间的间隔。
2. 建立跨会话长期记忆,使记忆能够延续到同一项目、同一群体的后续交流中。
3. 覆盖更多语种,进一步拓展至长尾语种和区域方言。
原文:Qwen3.8-LiveTranslate:听得清、译得准,更懂真实对话(来源:千问大模型)
