AI-NEWS · 2026年 8月 4日

MiniMax H3:全模态驱动视频生成

2024 年 8 月 3 日,MiniMax(稀宇科技)开源了下一代通用视频模型 H3。这不是简单的视频生成工具,而是一个能处理文本、图像、视频和音频的全模态系统。

H3 的生成规格比较灵活。默认输出时长在 4 到 15 秒之间,帧率 24 FPS,音频采样率 32 kHz。画幅支持 21:9、16:9、4:3 和 1:1 等多种主流比例。分辨率方面,默认是短边 768 像素的 768p,但如果用专门的 H3-Regenerate-2K 方案,能拉到 2K 分辨率。

多语言支持覆盖了 11 种主要语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、西班牙语、葡萄牙语和俄语。

输入模式分两种,适应不同创作需求。第一种是 H3-Base-FL2VA 首尾帧模式,允许输入 0 到 2 张图片。这能处理纯文本生视频,也能做首帧生视频、尾帧生视频,或者首尾帧协作。第二种是 H3-Base-Ref2VA 全模态参考模式,输入更复杂,最多能塞进 9 张图片、3 段不超过 15 秒的视频片段和 3 段音频片段,文件总数上限 12 个。这种配置给专业创作者留了精细控制的空间。

系统架构由三个模块串联。首先是 H3-Context-IR 上下文中间表示,负责把复杂的用户多指令转化成模型能读懂的结构化数据,保证后续生成质量。中间是 H3-Base 模块,生成基础版本的音视频,分辨率定在 768p。最后是 H3-Regenerate-2K 模块,基于初始生成结果和原始上下文做 2K 超分辨率重建。这个流程把从提示词到高清视频的转化打通了,在保留细节的同时提升了视觉保真度。

模型在 MiniMax H3 Community License 社区许可下发布,代码和资源都在 Hugging Face 上。开源降低了多模态视频生成的门槛,让更多开发者能参与内容创作。更重要的是,H3 支持的“首尾帧”及“多图多音多视频”混合输入,把视频生成从单纯的“文本驱动”推向了“全模态驱动”。对于需要快速验证创意或整合多素材的场景,这种工作流比等待纯文本生成要快,因为模型不用反复猜测上下文,直接利用提供的视觉和听觉线索就能生成成品。

火龙果频道