
视频生成
MiniMax-H3 · 单机
基于 MiniMax-H3 FL2VA 的单机音视频生成方案,集成原生音频生成与 1080p 超分辨率处理。性能数据对应图生视频工作流。
跨模态生成文本、图像 → 视频、音频
01 / 模型参数
模型架构与能力
MiniMax-H3 是原生音视频生成模型,能够根据文字、图像或多模态参考生成带声音的视频。FL2VA 分区支持纯文字、单张图像或首尾两帧输入;Ref2VA 分区面向参考图像、视频与音频的组合创作。不同分区和工作流的资源需求、生成耗时应分别查看。
- 文字或图像生成短片
- 图像生成带声音的视频
- 通过超分工作流提升分辨率
- 发布方 / 模型
- MiniMax · MiniMaxAI/MiniMax-H3
- 参数规模 / 架构
- 33B Omni-Transformer 稠密主干;其中约 13B AdaLN 分支可预计算后裁剪,另有文本编码器及音视频 VAE
- 输入 / 输出
- 文本、图像及多模态参考输入;视频与 32 kHz 立体声音频输出
- 官方生成规格
- 时长 4–15 秒、24 FPS,基础生成短边 768;实际本地输出由工作流配置决定
- 生成分区
- FL2VA:0 张图为文生视频,1 张为图生视频,2 张为首尾帧;Ref2VA:多模态参考生成
- 许可证
- MiniMax-H3 Community License
- 本页量化 / 分区
- FL2VA;Comfy-Org INT8 pruned 扩散权重约 20.97 GB
- 文本编码器与 VAE
- Qwen3-VL 32B NVFP4 AWQ 约 15.69 GB;视频 VAE 为 FP16,音频 VAE 为 FP32
FL2VA 分区支持文生视频与图生视频;本页 MegaCube 单机实测仅覆盖图生视频及超分工作流。1080p 是超分后输出,不是原生生成分辨率。
模型资料核对于 2026-09-20
02 / 部署方式
MegaCube 部署配置
- 计算设备
- 1 × MegaCube · NVIDIA GB10 · 128 GB
- 软件环境
- ComfyUI 0.35.0;Python 3.12.3;PyTorch 2.13.0+cu130
- 生成配置
- Turbo LoRA v4;strength=1.3;simple 调度器;10 步当前工作流
- 输出
- 1376×768 原生音视频;RealESRGAN x2 后处理到 1920×1080
- 执行方式
- 单任务本地执行,端口 8188
准备模型组件
下载扩散模型、文本编码器、两个 VAE 与 Turbo LoRA,按固定版本核对 SHA256。
配置 ComfyUI
在 ARM64 环境准备 ComfyUI 与相应节点,加载已验证的模型组合。
导入参考图
通过 MiniMaxH3ImageToVideo 工作流设置图像、提示词、帧数与步数。
保存输出
先生成原生音视频,再执行可选超分与封装;两种分辨率分别保存。
在本地模型商店中找到此模型,下载后按卡片指引部署并启用。
下载本地模型商店 →模型组件与固定版本
| 组件 | 仓库与固定 revision | 实际文件名 | 精度 / 当前设置 | 大小 |
|---|---|---|---|---|
| 扩散模型 | Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202af | minimax_h3_fl2va_pruned_int8_convrot.safetensors | INT8 pruned UNETLoader weight_dtype=default | 20,970,379,616 bytes 20.97 GB |
| 文本编码器 | Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202af | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | Qwen3-VL 32B NVFP4 AWQ,type=minimax | 15,687,142,551 bytes 15.69 GB |
| 视频 VAE | Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202af | minimax_h3_video_vae_fp16.safetensors | FP16 视频解码 | 5,207,808,496 bytes 5.21 GB |
| 音频 VAE | Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202af | minimax_h3_audio_vae_fp32.safetensors | FP32 音频解码 | 605,254,808 bytes 0.61 GB |
| Turbo LoRA | larryvrh/MiniMax-H3-Turbo-Lora 43a74557ac3f6539db8e0f2a959d03feb7a81480 | minimax_h3_turbo_v4_step600_ema.safetensors | v4 step600 EMA strength=1.3,low_vram=false | 779,849,816 bytes 0.78 GB |
| AI 超分 | Real-ESRGAN 官方发布 v0.2.1 | RealESRGAN_x2plus.pth | 2× 通用图像超分 随后裁切到 1920×1080 | 67,061,725 bytes 67.06 MB |
03 / 性能测试
MegaCube 性能测试结果
2026-09-09 至 2026-09-11。表格是早期 6/8 步基准;12 条成功任务为后续 10 步工作流的历史快照,两者不能套用耗时。客户端耗时包含约 5 秒轮询间隔。
12 / 12最近 ComfyUI 历史任务成功
399.06 s1376×768 / 6 步,客户端耗时
96.81 GiB同一基准整机内存峰值
| 配置 | 客户端总耗时 | 服务端 | 峰值内存 | 结果 |
|---|---|---|---|---|
| 640×384 / 6 | 95.84 s | 93.44 s | 87.69 GiB | 通过 |
| 832×480 / 6 | 116.37 s | 114.98 s | 90.29 GiB | 通过 |
| 832×480 / 8 | 141.66 s | 137.59 s | 91.36 GiB | 通过 |
| 1376×768 / 6 | 399.06 s | 396.44 s | 96.81 GiB | 通过 |
- 内存为每 5 秒采样的 MemTotal − MemAvailable,不是精确进程显存。
- 1080p 是超分后输出,不是模型原生 1080p 生成。
- 当前没有同条件的单机文生视频性能数据。
规划模型部署与应用集成
根据模型规模、业务任务与并发需求,评估设备配置和推理服务。