← 全部模型

视频生成

MiniMax-H3

面向原生音视频生成的多模态模型,支持文本、首尾帧与参考素材输入。四节点验证覆盖文生音视频、参考图像及参考视频生成。

跨模态生成文本、图像、视频、音频 → 视频、音频
4 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

MiniMax-H3 是原生音视频生成模型,能够根据文字、图像或多模态参考生成带声音的视频。FL2VA 分区支持纯文字、单张图像或首尾两帧输入;Ref2VA 分区面向参考图像、视频与音频的组合创作。不同分区和工作流的资源需求、生成耗时应分别查看。

  • 文字生成带声音的视频
  • 首尾帧控制的短片
  • 参考图片与视频创作
发布方 / 模型
MiniMax · MiniMaxAI/MiniMax-H3
参数规模 / 架构
33B Omni-Transformer 稠密主干;其中约 13B AdaLN 分支可预计算后裁剪,另有文本编码器及音视频 VAE
输入 / 输出
文本、图像及多模态参考输入;视频与 32 kHz 立体声音频输出
官方生成规格
时长 4–15 秒、24 FPS,基础生成短边 768;实际本地输出由工作流配置决定
生成分区
FL2VA:0 张图为文生视频,1 张为图生视频,2 张为首尾帧;Ref2VA:多模态参考生成
许可证
MiniMax-H3 Community License
本页模型文件
FL2VA / Ref2VA;281 个文件,共 498.475 GB

本次四机验证包含文生音视频功能,但下方耗时样本来自参考输入生成,不能代表文生视频完整性能矩阵。官方在线服务的 2K 工作流不等于此本地方案的原生能力。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
4 台 Cube 承担 TP4 推理
服务界面
原配置另用一台设备承载共享 ComfyUI 界面,不计入四台推理节点
运行环境
PyTorch 2.13.0+cu130;SGLang 0.5.18;ffmpeg
网络
RoCE 跨节点通信;NCCL 双接口,Gloo 管理接口
应用接入
异步视频 API 与 ComfyUI
  1. 准备计算节点

    对齐四台设备的软件环境,检查管理网络、RoCE 和 ffmpeg。

  2. 下载并校验

    下载 MiniMax/MiniMax-H3,核对 281 个文件及 SHA256。

  3. 启动模型分区

    同步 FL2VA / Ref2VA 权重与路径,按 TP4 启动目标分区。

  4. 提交生成任务

    通过 API 或 ComfyUI 提交任务、查询进度并保存音视频。

03 / 性能测试

MegaCube 性能测试结果

2026-09-04;四台推理节点。文生音视频验证为功能通过;下方两次生成耗时来自 Ref2VA 参考生成,均为 1344×768、约 5.17 秒、50 步。

通过T2VA 文本生成音视频
16.28 分钟Ref2VA 任务 A,非文生视频耗时
53–54 GiB每个推理节点稳态统一内存
功能与完整性验证
验证项方法 / 条件结果
权重完整性281 文件、498,474,765,023 字节,全量 SHA-256通过
T2VA文本输入,768p,50 步,生成同步音视频通过
FL2VA首帧 / 尾帧输入链路通过
Ref2VA参考图片、参考视频及视频音轨编码通过
异步视频 API提交、状态轮询、内容下载通过
ComfyUI自定义节点、Save Video、用户登录及资产 / 输出隔离通过
Ref2VA 生成耗时
任务视频规格采样步数生成耗时
任务 A1344×768 · 约 5.17 秒5016.28 分钟
任务 B1344×768 · 约 5.17 秒5016.20 分钟
  • 两次耗时是观测样本,不是平均值或 P95,也不代表文生视频的完整性能矩阵。
  • 演示视频时长为 10.125 秒,与上方 5.17 秒性能用例不同。
《白蛇传》· 1344×768 · 24 fps · 10.125 秒

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案