据MiniMax 稀宇科技消息,近日,MiniMax正式开源其新一代通用视频模型MiniMax H3。该模型是一个通用型全模态生成系统,能统一理解文本、图像、视频和音频构成的多模态上下文,并生成最高2K分辨率、最长15秒、带有原生立体声音频的视频。本次开源涵盖模型权重,并提供了本地部署与完整工作流验证方案。
H3系统由三个核心模块构成。H3-Context-IR负责深入理解并提炼用户输入的多模态指令,将其转换为结构化的上下文中间表示,目前通过API提供。H3-Base根据该中间表示生成768p分辨率的音视频内容,是本次开源的主体。H3-Regenerate-2K则将768p结果与原始上下文一同送回模型,以2K分辨率重新生成细节更准确的高画质视频,该模块尚未开源,同样通过API提供。
H3-Base采用33B参数的H3-Omni-Transformer架构,通过不同模态的编码器将文本、图像、视频和音频统一编码为多模态序列后进行联合预测。其视觉自编码器H3-VisualVAE和音频自编码器H3-AudioVAE分别对视觉和音频信息进行高效压缩。模型支持两种主要版本:H3-Base-FL2VA支持文生视频及首帧、尾帧、首尾帧生视频等模式;H3-Base-Ref2VA支持最多9张图像、3段视频和3段音频的混合输入,可用于人物与场景保留、动作与嘴型编辑等复合任务。模型稳定支持包括中文、英语、日语、韩语在内的11种语言对话。
为帮助社区正确部署,官方提供了两种验证路径。“H3-Base本地部署”方案支持通过SGLang、vLLM、diffusers、ComfyUI等框架进行推理,并提供了文生视频、首尾帧生视频和全模态参考视频三类可复现的768p音视频生成案例。“完整2K工作流”则结合本地部署的H3-Base与官方API,提供从指令解析、768p生成到2K再生成的端到端验证流程。模型基于MiniMax H3 Community License发布,开发者可前往Hugging Face开源地址下载使用。
原文:开放通用智能,MiniMax H3 正式开源(来源:MiniMax 稀宇科技)
