Qwen-Audio-3.0-ASR-Flash发布:强化上下文与行业词识别,语音识别一步直达润色文本

2026-07-31 11:59:32
来源:AI观察
分享
AIME

问财摘要

1、阿里云发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,在上下文一致性、行业词识别和热词定制化三个维度实现系统性优化,并具备语音润色能力,可直接输出结构化书面文本。 2、该模型在长音频场景下新增上下文记忆能力,能够有效减少同音词误判,确保跨片段的专业术语、中英文混说等识别保持连贯。 3、同时,新模型将多语种识别能力集成于一体,覆盖中文、日语、韩语等30种语言,平均语义错误率仅17.09%。 4、Qwen-Audio-3.0-ASR-Streaming版本面向客服通话、实时字幕等场景,中文工业场景平均错字率仅7.8%,英文工业场景为11.52%,均领先同类模型。
免责声明 内容由AI生成

据千问大模型消息,阿里云正式发布语音识别大模型Qwen-Audio-3.0-ASR-Flash,该模型在上下文一致性、行业词识别和热词定制化三个维度实现系统性优化,并具备语音润色能力,可直接输出结构化书面文本。此前,该系列模型曾在全球权威AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一。

长音频上下文连贯识别

针对会议、访谈等长音频场景,新模型新增上下文记忆能力。在转写当前语音时,它能参考近期已识别内容,顺着同一话题的关键词和语义进行判断,有效减少同音词误判,确保跨片段的专业术语、中英文混说等识别保持连贯,不再遗漏或认错。

行业词识别无需逐一配置

模型将各行业专业词汇内化为自身识别能力,无需人工维护词表。研究团队从医疗、IT编程、股票等领域持续挖掘专业词汇,构建高质量词库。在内部评测中,新模型对各行业专业词的“听中率”均有明显提升,其中医疗场景突破95.36%。

分级热词机制避免误触发

针对企业专属词汇需求,新模型升级即时热词定制能力,采用分级热词机制。在传入热词的情况下,所有测试集的热词“听中率”均达到90%以上,多数场景突破99%,实现了加词多而不乱,精准命中业务关键词。

识别与润色一步完成

模型可在识别环节直接完成语音润色,自动去除“那个”“嗯”等口头禅,清理口吃与重复,处理自我纠正,并进行语义重组,输出条理清晰的书面文本。评测显示,该能力与“先识别、再用大模型润色”的两步走方案效果基本持平,优秀可读率从30.75%提升至59.27%。

一套模型听懂30种语言

模型将多语种识别能力集成于一体,覆盖中文、日语、韩语、泰语、越南语、印尼语、马来语、印地语、阿拉伯语以及英、法、德、西、葡、俄等欧洲主流语言。用户只需告知会议可能涉及的语言,模型即可自动开启多语言混合识别。在七个语种的评测中,其平均语义错误率仅17.09%,优于Azure、ElevenLabs Scribe v2等模型。

低延迟实时识别

同步推出的Qwen-Audio-3.0-ASR-Streaming版本面向客服通话、实时字幕等场景,在保持理论出字延迟300毫秒的同时,中文工业场景平均错字率仅7.8%,英文工业场景为11.52%,均领先同类模型。

目前,Qwen-Audio-3.0-ASR系列已通过阿里云百炼平台开放调用,提供最长5分钟语音识别、离线文件转写和实时语音识别三个版本。

原文:Qwen-Audio-3.0-ASR-Flash:长音频不丢词,行业词不用教(来源:千问大模型)

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME