据MiniMax 稀宇科技消息,MiniMax正式发布通用全模态生成模型H3,该模型支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,并能输出具备原生双声道、最高15秒2K分辨率的音视频内容。公司同时宣布,计划在未来几天内,在符合相关法律法规的前提下开放模型权重,以推动开源社区发展并加速国产芯片适配。
H3在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现出色,可实现精准可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏(881275)等商业场景。根据前期邀测反馈,该模型已具备商用级的多场景内容生成能力。
在性价比方面,MiniMax表示得益于Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration等多项技术,H3默认提供2K分辨率,每秒价格不到主流模型的1/3,768P分辨率下不到1/2。
H3的模型特色包括多模态上下文理解与原生双声道音频。模型可融合图片、声音、视频等多模态信息源,通过自然语言描述上下文与目标视频的关系,自行完成复杂的全模态理解工作。其应用案例涵盖电影片头、游戏(881275)UI、动态海报及广告电商等领域。
H3的设计理念核心是打破任务边界,从专用模型迈向通用模型。其预训练范式强调任务统一与泛化,数据和任务涵盖文生图、文生视频(联合音频生成与多镜头建模)、文生音频(不区分人声、音效、音乐)以及广义的参考和编辑。其中,广义参考和编辑完全由真实自然数据构成,并由自然语言表述关系,不局限于有限任务。
在技术选择上,H3的核心技术包括:
- Contextual Omni Representation:通过定制模型和全模态理解管线,泛化Caption定义,联合描述视频、音频及多镜头关联,以语言作为可泛化的连结和解释,实现广泛的指令理解能力。
- H3-VAE:彻底革新前代tokenizer技术,在重建和易学性上取得全面提升,高压缩率带来4倍的序列长度收益,大幅降低训练和推理成本,是支持原生2K分辨率的关键。
- H3-Omni Transformer:采用理解与生成异构的训练架构,精细调优硬件利用率,端到端提升近30%的训练吞吐,以服务于任务泛化的目标。
- In-context Regeneration:利用H3基模对低分辨率结果进行上下文重新生成,复用基模生成能力并利用多模态上下文信息,超越传统超分方案,尤其能更好还原小文字和细节。
MiniMax认为,语言、图片、视频、音频构成的多模态上下文是高效表达信息的基础,而语言可作为可泛化的计算系统,多模态应紧密关联语言。H3后续版本将推动与M系列模型能力融合,持续进行模型Scaling,并追求更高分辨率和更精细的画面表现。
原文:MiniMax H3:打破任务和模态边界的开放模型(来源:MiniMax 稀宇科技)
