英特尔Day 0支持MiniMax H3多卡部署方案
「英特尔宣布为开源多模态视频模型MiniMax H3提供Day 0支持,锐炫Pro B70完成适配。团队开发了基于多卡GPU的部署方案,采用Encoder 8卡张量并行、DiT 8卡USP结合Layer-wise Offloading,以及VAE部署于B70的架构,实现视频生成全流程加速。同时推出2TP×4USP混合并行方案,优化通信开销,提升推理性能。」
英特尔近日宣布,为新一代开源多模态视频模型MiniMax H3提供Day 0首发支持,标志着其在AI推理加速领域又迈出重要一步。作为英特尔锐炫Pro B70显卡的首批适配模型之一,MiniMax H3的部署方案展现了英特尔在异构计算和并行优化方面的深厚积累。
据悉,英特尔团队针对MiniMax H3的架构特点,设计了一套基于多卡GPU的端到端部署方案。该方案将视频生成流程划分为三个关键模块:Encoder、DiT和VAE。其中,Encoder采用8卡张量并行(8TP)技术,高效完成文本编码任务;DiT作为推理过程中计算量最大的模块,采用8卡Ulysses Sequence Parallel(USP)并结合Layer-wise Offloading技术,使模型参数能够按层动态加载到GPU显存中。这一设计不仅突破了单卡显存限制,还大幅降低了模型常驻显存需求,为更大规模DiT模型的部署提供了可能;VAE则部署于B70 GPU上,负责最终的视频解码工作。整体架构实现了视频生成全流程的GPU加速,兼顾了模型容量与计算效率。
在此基础上,英特尔团队进一步优化了并行策略,开发了2TP×4USP的混合并行方案。相较于纯8卡USP,该方案将USP并行度从8降至4,并引入2路张量并行对计算进行协同加速。这种设计在保持模型扩展能力的同时,减少了USP带来的通信开销,实现了计算负载与通信开销之间的更优平衡,从而显著提升了整体推理性能。
此外,团队还结合llm-scaler-omni项目的XPU Kernel优化,对矩阵乘法、注意力等关键算子进行了持续优化。这些底层优化进一步提升了GPU的计算效率,降低了端到端推理时延,为视频生成模型的大规模部署提供了有力支持。
此次Day 0支持不仅体现了英特尔对开源AI生态的重视,也为开发者提供了更高效、可扩展的视频生成模型部署参考方案。随着多模态AI应用的普及,此类硬件与软件协同优化的实践将推动行业向更高效的方向发展。
来源:Heooo AI工具导航