
视频生成
MiniMax-H3
面向原生音视频生成的多模态模型,支持文本、首尾帧与参考素材输入。四节点验证覆盖文生音视频、参考图像及参考视频生成。
跨模态生成文本、图像、视频、音频 → 视频、音频
01 / 模型参数
模型架构与能力
MiniMax-H3 是原生音视频生成模型,能够根据文字、图像或多模态参考生成带声音的视频。FL2VA 分区支持纯文字、单张图像或首尾两帧输入;Ref2VA 分区面向参考图像、视频与音频的组合创作。不同分区和工作流的资源需求、生成耗时应分别查看。
- 文字生成带声音的视频
- 首尾帧控制的短片
- 参考图片与视频创作
- 发布方 / 模型
- MiniMax · MiniMaxAI/MiniMax-H3
- 参数规模 / 架构
- 33B Omni-Transformer 稠密主干;其中约 13B AdaLN 分支可预计算后裁剪,另有文本编码器及音视频 VAE
- 输入 / 输出
- 文本、图像及多模态参考输入;视频与 32 kHz 立体声音频输出
- 官方生成规格
- 时长 4–15 秒、24 FPS,基础生成短边 768;实际本地输出由工作流配置决定
- 生成分区
- FL2VA:0 张图为文生视频,1 张为图生视频,2 张为首尾帧;Ref2VA:多模态参考生成
- 许可证
- MiniMax-H3 Community License
- 本页模型文件
- FL2VA / Ref2VA;281 个文件,共 498.475 GB
本次四机验证包含文生音视频功能,但下方耗时样本来自参考输入生成,不能代表文生视频完整性能矩阵。官方在线服务的 2K 工作流不等于此本地方案的原生能力。
模型资料核对于 2026-09-20
02 / 部署方式
MegaCube 部署配置
- 计算设备
- 4 台 Cube 承担 TP4 推理
- 服务界面
- 原配置另用一台设备承载共享 ComfyUI 界面,不计入四台推理节点
- 运行环境
- PyTorch 2.13.0+cu130;SGLang 0.5.18;ffmpeg
- 网络
- RoCE 跨节点通信;NCCL 双接口,Gloo 管理接口
- 应用接入
- 异步视频 API 与 ComfyUI
准备计算节点
对齐四台设备的软件环境,检查管理网络、RoCE 和 ffmpeg。
下载并校验
下载 MiniMax/MiniMax-H3,核对 281 个文件及 SHA256。
启动模型分区
同步 FL2VA / Ref2VA 权重与路径,按 TP4 启动目标分区。
提交生成任务
通过 API 或 ComfyUI 提交任务、查询进度并保存音视频。
03 / 性能测试
MegaCube 性能测试结果
2026-09-04;四台推理节点。文生音视频验证为功能通过;下方两次生成耗时来自 Ref2VA 参考生成,均为 1344×768、约 5.17 秒、50 步。
通过T2VA 文本生成音视频
16.28 分钟Ref2VA 任务 A,非文生视频耗时
53–54 GiB每个推理节点稳态统一内存
| 验证项 | 方法 / 条件 | 结果 |
|---|---|---|
| 权重完整性 | 281 文件、498,474,765,023 字节,全量 SHA-256 | 通过 |
| T2VA | 文本输入,768p,50 步,生成同步音视频 | 通过 |
| FL2VA | 首帧 / 尾帧输入链路 | 通过 |
| Ref2VA | 参考图片、参考视频及视频音轨编码 | 通过 |
| 异步视频 API | 提交、状态轮询、内容下载 | 通过 |
| ComfyUI | 自定义节点、Save Video、用户登录及资产 / 输出隔离 | 通过 |
| 任务 | 视频规格 | 采样步数 | 生成耗时 |
|---|---|---|---|
| 任务 A | 1344×768 · 约 5.17 秒 | 50 | 16.28 分钟 |
| 任务 B | 1344×768 · 约 5.17 秒 | 50 | 16.20 分钟 |
- 两次耗时是观测样本,不是平均值或 P95,也不代表文生视频的完整性能矩阵。
- 演示视频时长为 10.125 秒,与上方 5.17 秒性能用例不同。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。