← 全部模型

视频生成

MiniMax-H3 · 单机

基于 MiniMax-H3 FL2VA 的单机音视频生成方案,集成原生音频生成与 1080p 超分辨率处理。性能数据对应图生视频工作流。

跨模态生成文本、图像 → 视频、音频
1 台 MegaCube已有实测报告

01 / 模型参数

模型架构与能力

MiniMax-H3 是原生音视频生成模型,能够根据文字、图像或多模态参考生成带声音的视频。FL2VA 分区支持纯文字、单张图像或首尾两帧输入;Ref2VA 分区面向参考图像、视频与音频的组合创作。不同分区和工作流的资源需求、生成耗时应分别查看。

  • 文字或图像生成短片
  • 图像生成带声音的视频
  • 通过超分工作流提升分辨率
发布方 / 模型
MiniMax · MiniMaxAI/MiniMax-H3
参数规模 / 架构
33B Omni-Transformer 稠密主干;其中约 13B AdaLN 分支可预计算后裁剪,另有文本编码器及音视频 VAE
输入 / 输出
文本、图像及多模态参考输入;视频与 32 kHz 立体声音频输出
官方生成规格
时长 4–15 秒、24 FPS,基础生成短边 768;实际本地输出由工作流配置决定
生成分区
FL2VA:0 张图为文生视频,1 张为图生视频,2 张为首尾帧;Ref2VA:多模态参考生成
许可证
MiniMax-H3 Community License
本页量化 / 分区
FL2VA;Comfy-Org INT8 pruned 扩散权重约 20.97 GB
文本编码器与 VAE
Qwen3-VL 32B NVFP4 AWQ 约 15.69 GB;视频 VAE 为 FP16,音频 VAE 为 FP32

FL2VA 分区支持文生视频与图生视频;本页 MegaCube 单机实测仅覆盖图生视频及超分工作流。1080p 是超分后输出,不是原生生成分辨率。

模型资料核对于 2026-09-20

02 / 部署方式

MegaCube 部署配置

计算设备
1 × MegaCube · NVIDIA GB10 · 128 GB
软件环境
ComfyUI 0.35.0;Python 3.12.3;PyTorch 2.13.0+cu130
生成配置
Turbo LoRA v4;strength=1.3;simple 调度器;10 步当前工作流
输出
1376×768 原生音视频;RealESRGAN x2 后处理到 1920×1080
执行方式
单任务本地执行,端口 8188
  1. 准备模型组件

    下载扩散模型、文本编码器、两个 VAE 与 Turbo LoRA,按固定版本核对 SHA256。

  2. 配置 ComfyUI

    在 ARM64 环境准备 ComfyUI 与相应节点,加载已验证的模型组合。

  3. 导入参考图

    通过 MiniMaxH3ImageToVideo 工作流设置图像、提示词、帧数与步数。

  4. 保存输出

    先生成原生音视频,再执行可选超分与封装;两种分辨率分别保存。

在本地模型商店中找到此模型,下载后按卡片指引部署并启用。

下载本地模型商店 →
模型组件与固定版本
模型组件与固定版本
组件仓库与固定 revision实际文件名精度 / 当前设置大小
扩散模型Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202afminimax_h3_fl2va_pruned_int8_convrot.safetensorsINT8 pruned UNETLoader weight_dtype=default20,970,379,616 bytes 20.97 GB
文本编码器Comfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202afqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsQwen3-VL 32B NVFP4 AWQ,type=minimax15,687,142,551 bytes 15.69 GB
视频 VAEComfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202afminimax_h3_video_vae_fp16.safetensorsFP16 视频解码5,207,808,496 bytes 5.21 GB
音频 VAEComfy-Org/MiniMax-H3 a98869194787969724c7425d95d0ed73ce9202afminimax_h3_audio_vae_fp32.safetensorsFP32 音频解码605,254,808 bytes 0.61 GB
Turbo LoRAlarryvrh/MiniMax-H3-Turbo-Lora 43a74557ac3f6539db8e0f2a959d03feb7a81480minimax_h3_turbo_v4_step600_ema.safetensorsv4 step600 EMA strength=1.3,low_vram=false779,849,816 bytes 0.78 GB
AI 超分Real-ESRGAN 官方发布 v0.2.1RealESRGAN_x2plus.pth2× 通用图像超分 随后裁切到 1920×108067,061,725 bytes 67.06 MB

03 / 性能测试

MegaCube 性能测试结果

2026-09-09 至 2026-09-11。表格是早期 6/8 步基准;12 条成功任务为后续 10 步工作流的历史快照,两者不能套用耗时。客户端耗时包含约 5 秒轮询间隔。

12 / 12最近 ComfyUI 历史任务成功
399.06 s1376×768 / 6 步,客户端耗时
96.81 GiB同一基准整机内存峰值
生成耗时与整机内存:分辨率 / 步数
配置客户端总耗时服务端峰值内存结果
640×384 / 695.84 s93.44 s87.69 GiB通过
832×480 / 6116.37 s114.98 s90.29 GiB通过
832×480 / 8141.66 s137.59 s91.36 GiB通过
1376×768 / 6399.06 s396.44 s96.81 GiB通过
  • 内存为每 5 秒采样的 MemTotal − MemAvailable,不是精确进程显存。
  • 1080p 是超分后输出,不是模型原生 1080p 生成。
  • 当前没有同条件的单机文生视频性能数据。
原生样片 · 1376×768 · 24 fps · 5.17 秒 · 含模型生成音频

规划模型部署与应用集成

根据模型规模、业务任务与并发需求,评估设备配置和推理服务。

咨询此模型方案