# 英特尔为开源多模态视频模型 MiniMax H3 提供 Day 0 支持，实现多卡 GPU 部署方案

- 来源：IT之家（RSS）
- 发布时间：2026-08-03 15:25
- AIHOT 分数：32
- AIHOT 链接：https://aihot.virxact.com/items/cmscy3ykp0rkqroeuf5v0hw09
- 原文链接：https://www.ithome.com/0/985/033.htm

## AI 摘要

英特尔宣布为开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持，锐炫 Pro B70 完成适配。团队实现基于多卡 GPU 的部署方案，采用 Encoder 8 卡张量并行、DiT 8 卡 USP 结合 Layer-wise Offloading 及 VAE 部署于 B70 的整体架构，并开发 2TP×4USP 混合并行方案以平衡计算负载与通信开销，提升推理性能。

## 正文

IT之家 8 月 3 日消息，英特尔今日宣布，为新一代开源多模态视频模型 MiniMax H3 提供 Day 0 首发支持。

据介绍，英特尔锐炫 Pro B70 第一时间完成对 MiniMax H3 的适配，英特尔团队实现了一种基于多卡 GPU 的部署方案。该方案采用 Encoder 8 卡张量并行（8TP）、DiT 8 卡 USP（Ulysses Sequence Parallel，并结合 Layer-wise Offloading），以及 VAE 部署于 B70 GPU 的整体架构，实现了视频生成全流程的 GPU 加速。

其中，Encoder 采用 8 卡张量并行完成文本编码；作为推理过程中计算量最大的模块，DiT 采用 8 卡 USP 并结合 Layer-wise Offloading 技术，使模型参数按层动态加载到 GPU，在突破单卡显存限制、降低模型常驻显存需求的同时，支持更大规模 DiT 模型的部署；VAE 则部署于 B70 GPU 上完成最终的视频解码。该方案兼顾了模型容量与计算效率，为大规模视频生成模型提供了更具扩展性的部署方式。

在此基础上，团队进一步结合张量并行（Tensor Parallel，TP）与 USP 的优势，开发了 2TP×4USP 的混合并行方案。相较于纯 8 卡 USP，该方案将 USP 并行度由 8 降至 4，并引入 2 路张量并行对计算进行协同加速，在保持模型扩展能力的同时，减少 USP 带来的通信开销，实现计算负载与通信开销之间更优的平衡，从而进一步提升整体推理性能。

IT之家获悉，团队还结合 llm-scaler-omni 项目的 XPU Kernel 优化，对矩阵乘法、注意力等关键算子进行了持续优化，进一步提升 GPU 的计算效率，持续降低端到端推理时延，取得了良好的优化效果。

《通用视频模型 MiniMax H3 正式开源，支持多模态上下文、2K 分辨率》
