Skip to main content
MiniMax H3 是 MiniMax 推出的通用全模态生成模型,可通过 MiniMax H3 API 节点在 ComfyUI 中使用。API 工作流在 MiniMax 的服务器上运行生成任务,因此无需下载模型,也不需要本地 GPU,已生成视频的每一秒都会计入你的 Comfy API 账户。 MiniMax H3 可生成带有原生立体声音频的视频:人声、音效和音乐会在同一次前向传播中共同建模,而非事后叠加。输出最高支持 2K 分辨率,每个片段时长 5-15 秒。 MiniMax H3 Max 是由 fal 基于 MiniMax H3 后训练的高速生成变体,在 ComfyUI 0.34.2 中加入相同的 API 节点。它以快于实时的速度生成,提示词最长支持 50,000 字符,提供 480P 和 768P 分辨率,并带有可选的两段式流程,由 ComfyUI 已支持的节点组成:先通过 MiniMax H3 Context IR 节点增强提示词,再用 MiniMax H3 Regenerate to 2K 节点重生成至 2K。 MiniMax H3 Max Turbo 是在 ComfyUI 0.34.4 中加入文生视频与首尾帧节点的更快速、更便宜的 H3 Max 选项。它以 480P 或 768P 渲染,并在首尾帧节点上取消了分辨率与比例选项,输出比例跟随输入帧。
这些 API 工作流会通过你的 Comfy 账户在 MiniMax 的服务器上运行。如需在自有硬件上本地运行 H3 进行商业用途,你需要获取 MiniMax 商业许可证,该许可证可通过唯一官方经销商 Comfy 购买。

MiniMax H3 擅长什么

  • 原生立体声音频:人声、音效和音乐与视频在单次前向传播中一起建模,而不是事后叠加
  • 高分辨率输出:每个片段时长为 5-15 秒,分辨率最高可达 2K
  • 文生视频:根据文本提示生成带音频的视频
  • 首尾帧视频:生成首帧与可选尾帧图像之间的运动
  • 参考条件生成:基于最多 9 张参考图像、3 个参考视频和 3 段参考音频生成视频
  • MiniMax H3 Max:更快的变体,提供 480P/768P 输出、长提示词和可选的 2K 上采样阶段。H3 Max 下 Reference 节点最多接受 12 个参考文件
  • MiniMax H3 Max Turbo:文生视频与首尾帧节点上最快的 H3 Max 选项,每秒费率约为 Max 的一半

示例输出

通过单个提示词进行文生视频生成,并带有原生立体声音频: 首尾帧生成,由模型创建两个帧之间的运动:
使用 API 节点需要保证你已经正常登录,并在受许可的网络环境下使用,请参考API 节点总览部分文档来了解使用 API 节点的具体使用要求。
请确保你的 ComfyUI 已经更新。本指南里的工作流可以在工作流模板中找到。如果找不到,可能是 ComfyUI 没有更新。如果加载工作流时有节点缺失,可能原因有:
  1. 你用的不是最新版(每夜版)。
  2. 启动时有些节点导入失败。

MiniMax H3 API 工作流

模板库为 H3 基础模型随附三个 API 示例工作流,为 H3 Max 随附四个,为 H3 Max Turbo 随附两个:
  • 文生视频:根据文本提示词生成视频
  • 首尾帧视频:在首帧和末帧图像之间生成视频
  • 参考生成视频:根据参考图像、视频和音频生成视频
  • H3 Max T2V / I2V / FLF2V / R2V:通过更快的 MiniMax H3 Max 模型运行相同的模式,每个工作流都内置了可选的提示词增强和 2K 上采样阶段
  • H3 Max Turbo T2V / I2V:通过最快的 MiniMax H3 Max Turbo 模型运行文生视频与首尾帧视频,同样内置可选的提示词增强和 2K 上采样阶段

MiniMax H3 Max

这四个 api_minimax_h3_max_* 模板通过相同的 API 节点在 MiniMax H3 Max 模型上运行:Text to Video 和 First-Last-Frame 节点在 ComfyUI 0.34.2 中加入了 H3 Max 选项,Reference to Video 节点则在 0.34.3 中加入。请将 ComfyUI 更新到至少 0.34.3 以运行全部模板。 H3 Max 以快于实时的速度生成,费率低于基础模型:480P 为 15.09 积分/秒,768P 为 24.14 积分/秒(见 Minimax 定价表)。每个 Max 模板在 Switch 节点后提供两个可选阶段,默认均为关闭:
  1. 提示词增强:生成前使用 MiniMax H3 Context IR 节点改写提示词。打开 Prompt Enhance 布尔值即可启用
  2. 上采样至 2K:对首次生成的视频运行 MiniMax H3 Regenerate to 2K 节点。打开 Upscale to 2K 布尔值即可启用
接线 Max 模板时请注意以下事项:
  • 如需上采样请以 768P 生成:Regenerate to 2K 节点仅接受 768P 源视频
  • 各节点时长保持一致:生成和提示词增强必须使用相同时长,否则各阶段会不同步。Regenerate to 2K 节点没有时长输入,它会以原始时长重新渲染提交的 768P 视频
  • 额外输入需重复接线:这三个节点不会自动共享额外上下文。如果添加参考视频、音频或另一张图像,请将相同的线同时接入 Context IR 和 Regenerate 节点

MiniMax H3 文生视频

通过 MiniMax H3 API 从文本提示词生成视频,并输出原生立体声音频。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 T2V”

提示词技巧

  1. 提示词:在一个文本块中描述整个场景以及伴随的音频(对白、音效、音乐)
  2. 时长:时长输入支持 5-15 秒;该工作流自带一个快速的 5 秒预览
  3. 分辨率和比例:API 以 2K 分辨率渲染;选择宽高比预设,例如 16:99:161:1
  4. 水印:AIGC 水印默认关闭;如有需要,可在节点的高级设置中启用

提示词编写指南

MiniMax 发布了一份官方的视频提示词编写指南,适用于 T2VA、I2VA、FL2VA 和 L2VA 基础生成模式。该指南解释了如何将提示词组织成按时序排列的镜头,并配合相机运动和音频(对白、音效、音乐),同时为每种模式提供了示例。

MiniMax H3 Max:文生视频

在更快的 H3 Max 模型上根据文本提示词生成视频。该模板默认以 768P 渲染,带有可选的提示词增强和 2K 上采样阶段。 MiniMax H3 Max 文生视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Max: Text to Video”

MiniMax H3 Max Turbo:文生视频

在最快的 H3 Max Turbo 模型上根据文本提示生成视频。模板默认以 768P 和 1:1 渲染,带有与 Max 模板相同的可选提示词增强和 2K 上采样阶段。需要 ComfyUI 0.34.4 或更高版本。 MiniMax H3 Max Turbo 文生视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Turbo: Text to Video”

MiniMax H3 首尾帧视频

通过 MiniMax H3 API 在首帧图像和可选末帧图像之间生成视频。输出的宽高比与输入图像保持一致。

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 FLF2V”

首帧:angel-warrior-demon-battle-start.png

工作流的首帧图像,或使用您自己的图像。

末帧:angel-warrior-demon-battle-end.png

工作流的末帧图像,或使用您自己的图像。

提示技巧

  1. first_frame 输入为必填;last_frame 为可选。模型会生成两者之间的运动
  2. 宽高比:输出跟随输入图像,因此请保持两帧的宽高比一致
  3. 图像约束:每帧的宽度和高度必须在 256 到 5760 像素之间,宽高比在 2:5 到 5:2 之间
  4. 提示词:描述两帧之间的过渡,以及您想要的音频(对白、音效、音乐)

提示词编写指南

MiniMax 为基础生成模式(T2VA、I2VA、FL2VA 和 L2VA)发布了官方的视频提示词编写指南。该指南解释了如何将提示词组织为带时间轴的镜头,包含相机运镜和音频(对白、音效、音乐),并为每种模式提供了示例。

MiniMax H3 Max:图生视频

在更快的 H3 Max 模型上让静态图像动起来。该模板将首帧输入 First-Last-Frame 节点(末帧保持可选),并带有可选的提示词增强和 2K 上采样阶段。 MiniMax H3 Max 图生视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Max: Image to Video”

输入图像:sneaker_black.png

工作流的输入图像,也可以使用你自己的图像。

MiniMax H3 Max Turbo:图生视频

在最快的 H3 Max Turbo 模型上让静态图像动起来。模板将首帧输入首尾帧节点,并带有可选的提示词增强和 2K 上采样阶段。需要 ComfyUI 0.34.4 或更高版本。 MiniMax H3 Max Turbo 图生视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Max Turbo: Image to Video”

MiniMax H3 参考转视频

通过 MiniMax H3 API,以参考图像、视频和音频作为条件生成视频。 MiniMax H3 参考转视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 R2V”

参考图像:9panel_storyboard_golden_hour_clay_court.png

该工作流的分镜参考图,也可以使用你自己的图像。

提示词技巧

  1. 按标签引用:在提示词中按顺序引用每个输入,例如 Image 1Video 1Audio 1
  2. 限制:最多 9 张参考图像、3 个参考视频和 3 段参考音频。每个视频或音频片段必须为 2–15 秒;参考视频与参考音频的总时长上限均为 15 秒。
  3. 音频需要视觉锚点:如果没有至少一个参考图像或参考视频,就无法使用参考音频。
  4. 视频要求:参考视频的帧率必须为 23.976–60 FPS。
  5. 提示词:为每个参考内容分配一个任务(身份、风格、动作、声音),并描述目标镜头;明确的分配通常效果要好得多。

提示词编写指南

MiniMax 为参考驱动生成(R2V)发布了一份官方的 全参考模式提示词编写指南。该指南涵盖改写输出的结构,包括主体定义、参考标签和保留度分析,以及如何为每个参考内容在目标镜头中分配角色。

MiniMax H3 Max:首尾帧视频

在更快的 H3 Max 模型上在首帧和末帧图像之间生成视频,带有可选的提示词增强和 2K 上采样阶段。 MiniMax H3 Max 首尾帧视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Max: FLF2V”

首帧:dream_face_first.png

工作流的首帧图像,或使用您自己的图像。

末帧:dream_face_last.png

工作流的末帧图像,或使用您自己的图像。

MiniMax H3 Max:参考转视频

在更快的 H3 Max 模型上以参考媒体为条件生成视频。H3 Max 下 Reference 节点最多接受 12 个参考文件,并提供 reference_detail 选项,可权衡参考图像分辨率与成本。 MiniMax H3 Max 参考转视频工作流预览

在 Comfy Cloud 上运行

在 Comfy Cloud 中打开

下载工作流

下载 JSON,或在模板库中搜索“MiniMax H3 Max: Reference to Video”

参考图像:burdened_warrior_in_dreamscape.png

该工作流的参考图像,也可以使用你自己的图像。