# MiniMax H3 通用多模态视频模型将于 8 月 3 日开源，最高支持 15s 2K 分辨率

- 来源：IT之家（RSS）
- 发布时间：2026-07-31 21:13
- AIHOT 分数：59
- AIHOT 链接：https://aihot.virxact.com/items/cms90m6zu08jvro7vrzyeczac
- 原文链接：https://www.ithome.com/0/984/379.htm

## AI 摘要

稀宇科技宣布推出 MiniMax H3 通用多模态视频模型，将于北京时间 8 月 3 日 0 点在魔搭社区正式开源。该模型支持对文本、图像、视频、声音的统一理解，可输出原生双声道音视频，最高支持 15s 2K 分辨率。官方称其默认提供 2K 分辨率，每秒价格不到主流模型的 1/3，768P 分辨率下为主流 720P 的 1/2。

## 正文

IT之家 7 月 31 日消息，稀宇科技今天宣布推出 MiniMax H3 通用多模态视频模型，魔搭社区显示，这款模型将于北京时间 8 月 3 日 0 点正式开源。

MiniMax H3 支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频，最高可支持 15s 2K 分辨率。

IT之家获悉，得益于 Contextual Omni Representation，H3-VAE，H3-Omni Transformer，In-context Regeneration 等多项技术，MiniMax 称有能力提供行业内最优的性价比，默认提供 2K 的分辨率，模型在 2K 分辨率下每秒价格不到主流模型的 1/3，768P 分辨率下是主流模型 720P 的 1/2。

官方表示，这款模型有以下亮点：

原生多模态理解与生成：支持文字、图片、音频、视频等多种输入，理解不同素材中的人物、动作、声音、情绪、镜头、风格与表达意图，并将多种参考信息自然融合。

视频 · 前往原文观看

多模态精准编辑与控制：支持对人物、物体、场景、声音与节奏进行多维度编辑，并具备精细化指令遵循能力。

视频 · 前往原文观看

商用级多场景内容生成：面向影视、广告、品牌、电商与游戏等真实商业内容场景，兼顾文字字幕、品牌信息、创意特效、产品展示、UI / UX 动态演示、游戏视觉及风格化表达。

视频 · 前往原文观看
