MiniMax 发布 MiniMax H3 开源权重
H3开源权重已上线fal、ComfyUI和vLLM-Omni,并适配RTX 5090消费级显卡。
事件全貌
2026年8月3日,MiniMax(稀宇科技)正式开源其新一代通用视频模型H3的权重。H3是一个33B参数的多模态生成系统,能够统一理解文本、图像、视频和音频,并生成最高2K分辨率、最长15秒、24 FPS的H.264视频,同时自带32 kHz原生立体声音频。
开源当天,H3即获得多个平台和工具的原生支持:权重上线fal平台,原生集成ComfyUI,支持文本生视频、图像生视频、首尾帧控制、参考视频及就地编辑五种工作流;同时获得vLLM-Omni的Day 0支持,提供兼容OpenAI的视频端点。
在消费级硬件适配方面,H3通过ComfyUI优化栈和动态RAM/SSD卸载技术,可在RTX 5090上运行,生成5秒768p视频约需5.5分钟。
本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。
报道时间线
- MiniMax 发布 33B 视频模型 H3,可生成同步立体声音频并适配 RTX 5090
MiniMax 发布 33B 视频模型 H3,可生成同步立体声音频,支持文本、图像、视频和音频多模态生成与编辑,片段最长 15 秒。ComfyUI 优化栈约 40GB,通过动态 RAM/SSD 卸载适配消费级显卡,RTX 5090 上生成 5 秒 768p 视频约需 5.5 分钟。
- MiniMax H3 开源即获 vLLM-Omni 支持
MiniMax H3 开源权重,并在 vLLM-Omni 中获得 Day 0 支持,提供兼容 OpenAI 的视频端点。该模型可将文本、图像、视频和音频作为单一上下文处理,支持文生视频、首/尾帧及多参考生成,输出 4-15 秒、最高 2K 24 FPS 的 H.264 视频并自带同步立体声。
- MiniMax H3 开源并原生接入 ComfyUI
MiniMax H3 权重正式开源,并在发布当天(Day 0)原生集成到 ComfyUI,支持文本生视频、图像生视频、首尾帧控制、参考视频及就地编辑五种工作流。H3 以多模态上下文理解为核心,可同时处理图像、音频和视频,并依据提示词解析其关联。
- MiniMax H3 开源权重上线 fal 平台
权重已开源,@fal 已准备好供开发者使用,Day 0 🙌 这不仅仅是获取 H3 的权限。开发者可以研究它、定制它、部署它,并借助背后的生产级基础设施将其推向更远。 #MiniMaxH3 #OpenWeights
- MiniMax H3 正式开源:通用全模态生成系统支持 2K 视频与原生立体声
MiniMax 正式开源新一代通用视频模型 H3,可统一理解文本、图像、视频和音频,生成最高 2K 分辨率、最长 15 秒、带 32 kHz 原生立体声音频的视频。