MiniMax H3 开源:音视频一锅端,2K 15 秒

你听过的AI视频生成工具,多数还卡在”文生视频”或”图生视频”两件事之间来回切换。2026年8月3日,MiniMax把H3正式开源,把文本、图像、视频、音频当成同一件事一起处理。

H3是个通用多模态生成模型,输出15秒、2K分辨率(短边约1440像素)、24帧每秒的视频,画面与原生立体声音频在同一次生成中同步产出。同一段提示词里可以塞进至多9张图、3段视频、3段音频。比如”参考视频1的希区柯克运镜,让图片2里的角色按音频3开口唱歌”,H3会自己理顺上下文的关系。

核心架构由四部分撑起来:Contextual Omni Representation把上百K token的原始素材压缩到约4K token,让语言成为跨模态的通用桥梁;H3-VAE把序列有效长度扩展4倍,配合原生2K输出;H3-Omni Transformer把理解与生成的算力分离,训练吞吐约提高30%;In-Context Regeneration让2K输出由模型自身在上下文内重画,不用外挂超分模块,小字、品牌标识都能保住。

生成任务分三档:纯文本驱动的t2va、首尾帧关键帧驱动的fl2va,以及参考素材驱动的ref2va——后者能绑定主体图像与参考音色,做口型同步与语音克隆。

价格上,2K同档每秒单价不到主流闭源模型的三分之一,768p每秒不到主流模型720p的一半。硬件适配是同步推进的:AMD用SGLang在MI355X和MI300X上跑出Day 0支持,8卡序列并行;摩尔线程同日在国产AI训推卡MTT S5000上完成适配。开源采用MiniMax Community License,权重将在未来几天放出。

说白了,H3的看点不是又一个”文生视频”,而是把图像生成、参考控制、编辑拉到同一个框架里。OpenAI Sora 2、字节Seedance 2.5与谷歌Gemini Omni Flash分占不同赛道,H3在编辑与可控参考上领先,但纯文生视频和图生视频环节未必都第一。

我的判断是,2026年下半年AI视频工具的PK标准会从”几秒高清”改成”多模态可控+开源可改+多硬件可跑”。H3把三条都点上了。想试的话,盯紧开源权重放出的那一天。

来源:MiniMax Research 官方博客、AMD Developer Blog、36氪