大模型之家讯 8月3日,MiniMax(稀宇科技)正式开源新一代通用视频模型 MiniMax H3,这是该公司首款开源的多模态生成模型。据官方介绍,H3 能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频,输出帧率为 24 FPS,稳定支持包括中英文在内的 11 种语言。

从架构上看,H3 由 H3-Context-IR、H3-Base 与 H3-Regenerate-2K 三个模块组成。其中 H3-Context-IR 负责理解并提炼输入的多模态指令,将其转换为可直接用于生成的结构化表示;H3-Base 根据其输出生成 768p 的音视频结果;H3-Regenerate-2K 则通过 in-context 方式将 768p 结果与原始上下文一并送回模型,以 2K 分辨率重新生成,从而保留小文字、精细细节等信息。

H3-Base 以 FL2VA 和 Ref2VA 两种 checkpoint 形式发布,分别支持文生视频、首尾帧生视频,以及基于参考图像、视频和音频的全模态参考生成。其核心的 H3-Omni-Transformer 拥有 33B 参数,文本编码器采用了 Qwen3-VL-32B 的完整预训练权重。模型权重已在 Hugging Face 开放,支持通过 SGLang、vLLM、diffusers 和 ComfyUI 等框架进行本地部署。

需要指出的是,H3-Context-IR 与 H3-Regenerate-2K 两个模块本次未随模型一同开源,MiniMax 以 API 形式提供官方工作流供开发者调用,并承诺尽快开放 H3-Regenerate-2K。模型采用 MiniMax H3 Community License 发布。据第三方报道,H3 的视频生成价格约为 0.8 元/秒,其在 ArtificialAnalysis 视频编辑能力榜单中排名全球第一。
原创文章,作者:志斌,如若转载,请注明出处:http://www.damoai.com.cn/archives/17767