据字节跳动Seed消息,字节跳动正式推出原生音视频全双工大模型SeedRealtime,并在豆包App全量上线,在业界率先实现音视频全双工技术的规模化落地。该模型采用统一架构原生融合音频、视频与文本,可在连续的多模态信息流上实时交互,带来“边看、边听、边说”的全新体验。
SeedRealtime实现了三项核心突破。音视频联合理解方面,模型原生支持声音、画面与时序信息的深度融合,既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代。主动的交互能力方面,模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达。流畅的交互节奏方面,模型能实时感知用户的对话状态与交流节奏,在适当时机自然接话、停顿与回应,同时具备较强的抗干扰能力,能分辨旁人闲聊与背景噪声。
端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半,对说话时机的把握更加自然,被背景杂音与闲聊误触发等现象显著减少,单次对话完整顺畅交流的概率也有明显提升。
SeedRealtime将声音、画面、时序与表达统一到同一个端到端模型中,让感知、理解、决策与表达在连续音视频流上同步进行,解决了级联系统延迟叠加、信息损耗以及半双工交互等问题。
在音视频联合理解方面,模型能在多人聚餐场景中根据外形特征将名字与人对号入座,并分辨每句话出自谁,给出兼顾各人需求的方案;也能在川菜馆中直接从画面认出菜品,用英语推荐并解释文化背景,同时理解服务员的话语并翻译。
在主动交互方面,用户在河北博物院逛展时交代“看到某件展品就提醒我”,模型在镜头移动中识别到目标展品后便会出声提醒,并讲解其他文物与工艺;操作咖啡机时,当用户将整粒咖啡豆倒入萃取手柄,模型能快速纠错,并在萃取后基于视觉解析给出调整建议;研读论文时,模型可结合结构图讲解,并在用户要求下于快速翻页中准确识别目标段落并主动叫停,随即报出关键训练配置。
在交互节奏方面,模型能基于多模态信息持续决策。在大兴机场嘈杂环境中,模型不会被同伴闲聊中的无关对话触发,当用户正式问起时仍能结合此前看到的航班信息作答并联网提供行李转盘位置,随后扫到网约车指示牌时自然接话给出指引;在陪伴学习场景中,背景有人接电话,模型仍能始终跟随女孩手指的方向实时纠音、举例造句,该出声时不迟疑,受干扰时不跑偏。
未来,SeedRealtime将在更低的延迟与更自然的节奏、更主动的感知与决策、更稳健的多人复杂场景以及从“能对话”到“能行动”等方面继续突破,让AI交互能在连续变化的真实场景中理解上下文、把握时机并提供帮助。
原文:SeedRealtime 音视频全双工大模型发布:走向全模态自然交互(来源:字节跳动Seed)
