# MiniMax H3 发布：开源全能多模态生成模型，支持 2K 原生立体声视频

- 来源：MiniMax：Blog（网页）
- 作者：MiniMax
- 发布时间：2026-07-31 17:59
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms8rt1ml06j0roghw1n7a4bq
- 原文链接：https://www.minimax.io/blog/minimax-h3

## 精选理由

MiniMax H3 把全模态生成打到了 2K 分辨率且价格不到主流三分之一，还计划开源权重，这对闭源视频模型是实打实的压力，开发者可以重点关注。

## AI 摘要

MiniMax 正式推出全能多模态生成模型 H3，可联合理解文本、图像、视频和音频，生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出，2K 下每秒价格低于主流模型三分之一，768p 下低于主流 720p 价格一半。官方计划近日开源模型权重，以支持开源社区并加速硬件兼容。

## 正文

今天，我们正式发布 MiniMax H3，一款通用全模态生成模型。H3 能够联合理解涵盖文本、图像、视频和音频的多模态上下文，并支持生成最高 2K 分辨率、时长 15 秒、自带原生立体声的视频。

早期测试表明，MiniMax H3 在广泛的应用场景中都能提供达到生产级水准的内容生成能力。它在指令遵循、准确的文字与品牌呈现，以及 V2V 动作迁移方面表现出色。凭借精准、可控的多模态生成与编辑能力，H3 面向广告、品牌营销、电商、产品设计、UI/UX、游戏等领域打造。

依托上下文全模态表征（Contextual Omni Representation）、H3-VAE、H3-Omni Transformer 以及上下文内再生成（In-Context Regeneration）等核心技术，H3 实现了业界领先的性价比。我们默认提供 2K 分辨率输出。在 2K 分辨率下，H3 的每秒价格不到主流模型的三分之一；在 768p 分辨率下，其价格不到主流模型 720p 价格的一半。

长期以来，闭源模型一直主导着视频生成领域，其迭代速度较慢，生态开放性也不如大语言模型等领域。为了支持开源社区、加速与更广泛 AI 硬件的兼容适配，并让用户更轻松地构建自己的定制版本，我们计划在近日内开放模型权重，具体以适用法律法规为准。硬件兼容性从 H3 设计的最初阶段起就是关键考量因素。

多模态上下文理解

真正的创意工作需要融合跨模态的复杂信息，将图像、音频、视频等作为输入来源。例如，下图的提示词是：“参考视频 1 中的希区柯克式运镜，让图像 2 中的角色演唱，人声与音频 3 相匹配。”只需用文字描述上下文与目标视频之间的关系，H3 便能自主完成复杂的全模态理解。

输入：

视频 · 前往原文观看

图像 2

H3 生成的视频：

视频 · 前往原文观看

2K 画质表现

视频 · 前往原文观看

原生立体声

视频 · 前往原文观看

H3 应用场景

电影片头

视频 · 前往原文观看

产品网站

视频 · 前往原文观看

动态海报

视频 · 前往原文观看

广告与电商

视频 · 前往原文观看

H3 的设计理念

打破任务边界：从专用走向通用

我们此前开发了两代模型：Hailuo 01 从零开始搭建了整个系统，Hailuo 02 则聚焦于改进核心组件，如架构效率、数据质量和规模。

在设计 H3 时，我们认识到此前生成模型在任务边界上的局限：图像生成通常被拆分为独立的专家模型，分别处理文生图、编辑、主体参考、运动参考和风格参考；音频生成中的语音、音效和音乐在很大程度上被当作彼此独立的领域来研究；视频生成则进一步碎片化为文生视频、图生视频、首尾帧、主体参考、运动参考、语音参考、视频编辑等，同时图像、视频和音频之间也存在清晰的边界。

这些彼此割裂的任务、能力和模态，在实践中限制了创作自由。在训练侧，也封顶了模型的泛化能力。这两点都指向了巨大的变革空间——无论是应用范式还是训练范式。因此，指导 H3 开发的第一条原则就是跨任务统一与泛化。

基于此，以下是 H3 预训练范式的简要概览：

数据与任务

文生图

文生视频

联合生成音频，所有音频输出均为原生立体声

原生多镜头建模

文生音频

语音、音效和音乐之间不设界限——全部联合建模

泛化参考与编辑

图生图参考与编辑

图生视频参考与编辑

音频到音频参考与编辑

音视频到音视频参考与编辑

在我们的设计中，“泛化参考与编辑”意味着：

完全基于真实、自然的数据构建，具备强大的数据可扩展性

参考与编辑关系通过自然语言表达，而非局限于固定的任务集合；语言（或广义上的智能结构）是通往泛化的桥梁

架构

尽可能早地融合多样化的数据类型和任务——正确的混合比例是关键

训练策略

在训练中尽早融合多样化的数据类型和任务——正确的混合比例是关键

这些选择都指向同一个目标：让 H3 从预训练阶段起就具备广泛的 multimodal（多模态）上下文理解与生成能力。

前面我们谈到了训练范式的转变，那么视频模型的应用格局又在发生怎样的变化？

我们看到创作者直接用自然语言描述他们的意图，而不再只是输入一个简单的视觉提示词。随着多模态理解、指令遵循和复杂任务执行能力的不断提升，视频模型将能够把握更完整的创作意图，处理更复杂的内容需求，并逐步从“生成一段片段”走向真正参与整个内容生产流程。

H3 的技术选型

H3 建立在简洁的设计理念之上，但将其落地却异常复杂。从 Hailuo 01 到 Hailuo 02，再到 H3，每一代的构建复杂度都比上一代高出一个数量级。

简要介绍 H3 的一些核心技术：

H3-Contextual Omni Representation（上下文全模态表征）

在工程化 H3 的过程中，我们做的最重要的事情之一就是强化其 captioning（视频描述）能力。

引入多模态上下文进一步拓宽了“caption”需要覆盖的范围——我们不再只是描述目标视频，还要描述上下文与目标视频之间的关系，甚至包括上下文内部各元素之间的关系。

我们需要联合描述视频和音频，而这种视听关系在跨多个镜头时会变得更加复杂。

这本质上是一种 Contextual Omni Representation 形式，语言在其中充当可泛化的桥梁和解释器，将“任务”统一为一种开放的、描述性的形式。这正是 H3 广泛指令遵循能力的根源。

为了实现这一点，我们构建了专用模型和全模态理解流水线。大多数源素材需要约 100K token 的推理量，经过蒸馏后平均压缩到约 4K token。

H3-VAE：架构效率的重大提升

H 系列在 tokenizer 技术上一路持续突破。在 H3 中，我们彻底重构了此前的 tokenizer，在重建质量和可学习性上实现了全面跃升，为 H3 带来了效率上的竞争优势。其高压缩比还带来了 4 倍的有效序列长度增益，大幅降低了训练和推理成本，同时也是我们原生 2K 分辨率支持背后的关键技术。

H3-Omni Transformer

H3-Omni Transformer：为任务泛化而生的架构

秉承 H3“架构服务于任务”的设计理念，通用性和效率是仅有的两个目标。值得注意的是，我们搁置了 Hailuo-02 架构，尽管它曾为我们带来显著的架构优势，因为对于一个围绕任务泛化构建的模型而言，它会引入不必要的复杂性。我们相信任务泛化是不可逆转的趋势，架构上的技巧应当让位于模型本身的定义方式。

在 H3 中，多模态上下文的引入使序列长度的方差扩大了三倍，理解和生成的计算负载也变得更加异构。我们采用了一种将理解与生成负载分离的训练架构，分别针对两者优化硬件利用率，同时在逐样本异构计算与跨样本负载均衡之间进行联合权衡。端到端来看，这使训练吞吐量提升了近 30%。

H3-上下文内再生成

对于 H3 的 2K 输出，我们没有采用传统的专用超分模块，而是让 H3 基座模型在上下文内对自身的低分辨率输出进行再生成。这带来两大优势：第一，再生成过程最大程度地复用了 H3 基座模型内已具备的生成能力；第二，上下文内方式使其能够再次利用原始多模态上下文来生成高分辨率输出，从而恢复传统超分只能“猜测”且往往无法还原的细节，比如小字号文字和精细纹理。

我们很快将发布完整的 H3 技术报告。期待听到大家的反馈。

我们的愿景与下一步

语言、图像、视频和音频是人类体验的基本模态。它们彼此深度关联，是我们与世界交互的主要界面。它们共同构成多模态上下文，能够高效传达海量信息，而表达和分享信息的能力本身就是一种生产力。

对于多模态理解与生成，我们将语言视为一种可泛化、可扩展的计算系统。正因如此，我们相信多模态智能应当深深扎根于语言之中。

H3 仍有成长空间，以下是我们在未来版本中的优先方向：

强大的多模态理解是高质量生成的基础，而这一方面仍有很大的提升空间。在下一代 H 系列中，我们计划整合 M 系列模型的能力。

H3 当前的模型规模在多项能力上仍有改进余地。扩展规模是一条明确的路径，我们相信更强的任务泛化能力将帮助我们充分释放其潜力。

视觉细节在特定场景下仍有提升空间。我们将继续朝着更高分辨率和更高视觉保真度迈进。
