# MiniMax H3 正式开源：通用视频模型支持多模态上下文与 2K 分辨率

- 来源：IT之家（RSS）
- 发布时间：2026-08-03 10:52
- AIHOT 分数：68
- AIHOT 链接：https://aihot.virxact.com/items/cmscne3ve0eurroeufwk70rsq
- 原文链接：https://www.ithome.com/0/984/937.htm

## AI 摘要

MiniMax 今日正式开源新一代通用视频模型 MiniMax H3，可统一理解文本、图像、视频和音频构成的多模态上下文，生成最高 2K 分辨率、最长 15 秒且带原生立体声音频的视频。

## 正文

IT之家 8 月 3 日消息，今日 MiniMax 正式开源新一代通用视频模型 MiniMax H3。

据介绍，MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文，并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计，H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力，因此能够出色地遵循复杂的多模态指令。

IT之家注意到，H3 支持以下输入与输出规格：

输出时长：4–15 秒

输出宽高比：支持多种宽高比，包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16

输出分辨率：支持多种分辨率尺寸，默认将较短边设置为 768 像素。使用 H3-Regenerate-2K 可实现 2K 分辨率生成

输出帧率：24 FPS

输出音频：32 kHz 立体声

支持的对话语言：稳定支持 11 种语言：阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。对于其他语言，也提供不同程度的支持。

模型版本与输入规格：

① H3-Base-FL2VA

首尾帧模式：支持输入 0 张、1 张或 2 张图像：

不输入图像时，为文生视频模式；

输入首帧图像时，为首帧生视频模式；

输入尾帧图像时，为尾帧生视频模式；

同时输入首帧和尾帧图像时，为首尾帧生视频模式

② H3-Base-Ref2VA

全模态参考模式：

图像：最多 9 张；

视频：最多 3 段；每段时长须为 2–15 秒，总时长不超过 15 秒；

音频：最多 3 段。音频必须与图像或视频一同输入，不能作为唯一输入；每段时长须为 2–15 秒，总时长不超过 15 秒；

混合输入： 所有类型输入文件合计最多 12 个

完整的 H3 系统由以下三个模块组成：

H3-Context-IR：随着输入日益复杂，我们构建了一套专门的系统，用于深入理解和提炼输入的多模态指令，并将其转换为 H3 更易于理解、可直接用于生成的形式，即 Context Intermediate Representation（上下文中间表示）。H3-Context-IR 对最终输出质量非常重要。因此我们强烈建议将 H3-Context-IR API 接入生成流程。或者，可参考提示词指南搭建自己的上下文处理系统。

H3-Base：根据 H3-Context-IR 的输出生成音频和视频，并输出 768p 分辨率的结果。

H3-Regenerate-2K：将 768p 的生成结果连同原始上下文一并送回 H3，以 2K 分辨率重新生成输出。这既发挥了 H3 强大的生成能力，又充分利用了原始上下文中蕴含的丰富信息，从而生成细节更准确、视觉保真度更高的高分辨率结果。

MiniMax H3 基于 MiniMax H3 Community License 发布。

开源地址：huggingface.co/MiniMaxAI/MiniMax-H3
