据生数科技消息,7月3日,生数科技在2026全球数字经济(885976)大会上正式发布面向实时交互场景的新一代模型Vidu S1,推动AI视频从“生成一段内容”迈向“持续进行互动”。该模型支持实时视频通话与语音控制,可实现无限时长连续互动,并支持用户上传单张图片快速创建专属交互角色,带来自然流畅的沉浸式体验。
Vidu S1打破了传统视频生成“输入提示词—等待生成—播放结果”的离线模式。用户可在视频通话中持续输入语音,模型能结合语音内容、对话上下文和当前画面,实时生成角色的后续内容与动作。该模型将语音从驱动口型的音频信号,升级为控制角色视觉行为的实时指令,能够理解语义、意图与情绪,实时生成相匹配的表情、眼神、手势及全身动作,让数字人进化为能理解用户、即时回应的生成式角色。
在生成机制上,Vidu S1采用自回归扩散模型路线,基于历史画面与当前指令持续预测并生成后续内容,首次实现无限时长的实时视频生成。即使连续生成数小时,画面仍能保持稳定,角色形象一致、动作自然连贯,并能持续接收语音指令并实时响应。
角色创建方面,Vidu S1采用纯生成式技术路线,无需建模与训练。用户只需上传一张初始图片,模型即可理解角色身份与风格,实时生成口型、表情和动作。无论是真人、动漫角色还是萌宠形象,均可快速转化为可互动的生成式角色,并支持自定义音色,大幅降低了实时角色的创建门槛。
为保障实时交互体验,Vidu S1在模型加速、推理引擎和集群部署上进行协同优化,实现540P高清分辨率、25FPS流畅帧率(最高支持42FPS)的实时视频生成。模型侧基于TurboDiffusion推理加速框架及多项推理优化技术,大幅降低计算成本;系统侧基于TurboServe推理部署引擎,实现高效请求调度与动态资源分配,完成了从“把视频生成得更快”到“让视频持续在线、稳定输出、实时响应”的关键跨越。
Vidu S1的发布标志着视频生成从离线内容输出走向实时双向交流,可广泛应用于AI情感陪伴、虚拟偶像、互动直播、游戏(881275)NPC、智能客服、在线教育(885480)及XR等场景。目前,Vidu S1已开启内测,用户可通过线上地址、API或「Vidu AI Pro」APP进行实时互动体验。
原文:生数科技发布 Vidu S1,推动视频生成迈向“实时交互”新时代(来源:生数科技)
