据千问大模型消息,阿里云正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,该模型在上下文一致性、行业词识别和热词定制化三个维度实现系统性优化,并具备语音润色能力,可直接输出结构化书面文本。此前,该系列模型曾在全球权威AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一。
长音频上下文连贯识别
针对会议、访谈等长音频场景,新模型新增上下文记忆能力。在转写当前语音时,它能参考近期已识别内容,顺着同一话题的关键词和语义进行判断,有效减少同音词误判,确保跨片段的专业术语、中英文混说等识别保持连贯,不再遗漏或认错。
行业词识别无需逐一配置
模型将各行业专业词汇内化为自身识别能力,无需人工维护词表。研究团队从医疗、IT编程、股票等领域持续挖掘专业词汇,构建高质量词库。在内部评测中,新模型对各行业专业词的“听中率”均有明显提升,其中医疗场景突破95.36%。
分级热词机制避免误触发
针对企业专属词汇需求,新模型升级即时热词定制能力,采用分级热词机制。在传入热词的情况下,所有测试集的热词“听中率”均达到90%以上,多数场景突破99%,实现了加词多而不乱,精准命中业务关键词。
识别与润色一步完成
模型可在识别环节直接完成语音润色,自动去除“那个”“嗯”等口头禅,清理口吃与重复,处理自我纠正,并进行语义重组,输出条理清晰的书面文本。评测显示,该能力与“先识别、再用大模型润色”的两步走方案效果基本持平,优秀可读率从30.75%提升至59.27%。
一套模型听懂30种语言
模型将多语种识别能力集成于一体,覆盖中文、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语以及英、法、德、西、葡、俄等欧洲主流语言。用户只需告知会议可能涉及的语言,模型即可自动开启多语言混合识别。在七个语种的评测中,其平均语义错误率仅17.09%,优于Azure、ElevenLabs Scribe v2等模型。
低延迟实时识别
同步推出的Qwen-Audio-3.0-ASR-Streaming版本面向客服通话、实时字幕等场景,在保持理论出字延迟300毫秒的同时,中文工业场景平均错字率仅7.8%,英文工业场景为11.52%,均领先同类模型。
目前,Qwen-Audio-3.0-ASR系列已通过阿里云百炼平台开放调用,提供最长5分钟语音识别、离线文件转写和实时语音识别三个版本。
原文:Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教(来源:千问大模型)
