大家好,我是老鹿。今天带来MiniMax H3视频生成整合包。
制作周期较长,敬请谅解。制作不易,恳请各位鹿友一键三连。
MiniMax是上海稀宇科技的品牌名,H3是模型名。
这个项目应该不用过多介绍了吧,目前开源视频模型里堪称王炸。大家比较熟悉的海螺AI平台,也是他们的产品。
MiniMax H3是一款多模态视频生成模型,支持文生视频、图生视频、首尾帧控制、多图参考、音频驱动和视频驱动,最长可生成15秒的视频。

项目地址:https://github.com/MiniMax-AI/MiniMax-H3
由于开源生态中,无论是模型还是节点,MiniMax H3的更新都十分频繁,后续我也会根据实际情况对整合包进行优化和调整,欢迎大家持续关注。
本次整合包我做了两个版本,分别是无Sage版和Sage加速版。
无Sage版测试设备为1070显卡,Sage加速版测试设备为A4000显卡,因此理论上前者支持10系、16系、20系等显卡,后者支持30系、40系、50系等显卡。
模型已分开上传,大家可以根据自己的实际情况选择对应版本下载。
先下载整合包,解压路径不要包含中文;再下载模型,并放入整合包根目录下的models文件夹。
双击exe即可启动;也可以双击用于调试的bat文件,区别在于bat启动后可直接查看日志,方便排查报错。
整合包主要分为两大功能板块:文生/图生视频,以及全能参考。
文生/图生视频模式下,不上传图片、仅输入提示词即为文生视频。
官方支持的常见宽高比已设为预设选项,大家可直接从下拉框中选择。
同时,我预设了短边选项。例如,选择竖屏比例后,设定短边尺寸,系统会自动匹配对应的高度。
当然,你也可以手动输入自定义分辨率。官方规定分辨率必须为32的倍数,因此我设置了自动运算功能,输入数值后按回车键,系统会自动将其调整为最接近的32的倍数。
官方最长支持生成15秒视频,因此此处时长上限设为15秒。
整合包使用的是 LightX2V 的 4步Turbo版,因此 LoRA 默认勾选,采样步数固定为4步。
建议保持默认设置,修改参数可能影响生成效果;保留这两个选项是为便于后续适配其他版本。
生成按钮旁可调整生成次数,最多一次性生成10个视频,方便抽卡。
无Sage版整合包未集成Sage加速,点击生成视频时会弹窗提示不支持,后台自动关闭该选项,不影响正常使用。
我用1070显卡(8G显存,32G内存)实测,能运行,但速度较慢。
因此理论上8G显存、32G内存即可运行。若使用支持Sage加速的显卡,速度会有明显提升。
每次抽卡的seed值可在日志中查看,或从生成视频的文件名中找到。若生成满意效果,可开启固定seed功能。
之后可使用高清修复功能进行放大,最高倍率为2倍。建议先以低分辨率抽卡,固定seed值后再放大。
生成过程中可随时停止;
点击
“打开目录”
按钮可直接跳转至视频输出文件夹;
“清除缓存”
会清空生成时加载到 input 文件夹的临时文件;
“释放显存”
用于释放当前模型占用的显存资源。
MiniMax H3 对提示词书写要求较为严格。
官方已开源提示词书写的 Skill,我将其集成至整合包。点击
“立即优化”
,即可按官方格式自动优化你的提示词。
提示词优化功能我花费了大量时间进行迭代,修改文件超过50轮。
但由于该功能基于本地 Qwen3VL-4B 模型运行,处理速度较慢,且优化效果可能有限。若条件允许,建议使用在线大模型来处理提示词。
可以看到,优化后的提示词所生成的视频效果明显优于优化前,且不会出现烦人的字幕。
有时你可能觉得优化效果不佳,这通常是因为优化前输入的提示词过于简单。我在模板中添加了一个内置示例。
大家可根据内置示例的格式书写提示词,再点击优化提示词;此外,整合包还添加了模板保存功能,方便复用自己满意的提示词。
上传图片并输入提示词,即为图生视频。使用 A4000(16G 显存,32G 内存)设备,生成一段 3 秒、分辨率 768×1376 的视频,耗时约 176.9 秒。
二次采样放大采用分块放大,且得益于ComfyUI在相同参数下不会重复运算的特性,放大速度较快。放大1.35倍耗时约193.3秒。
文生/图生视频模式下,上传两张图即生成首尾帧视频。由于参考图片增加,生成耗时也会相应增加。
全能参考模式下,上传多张图片即为多图参考,目前暂时最多支持三张图。
全能参考模式下,会多出一个“参考图尺寸”选项,默认选项为 Match。选择 Max 精度最高,但代价是增加运算时长。
音频参考可用音频驱动图片中的人物说话或唱歌。这里提示两点:
第一,若需人物唱歌,请务必写出歌词,否则唇形同步效果将明显变差。
第二,若音频素材时长大于视频生成时长,后台会自动裁剪素材,但建议使用 WAV 格式。
若使用 MP3 格式,需手动裁剪,自动裁剪后生成的唇形同步会略有偏差,后续再考虑是否有办法修复。
视频参考模式下,书写提示词时建议手动写明视频风格,如有分镜安排也可一并写出,这样优化后的提示词会更准确。
视频参考是所有模式中最耗费资源的一种,与参考视频时长密切相关。
尤其是启用高清修复功能时,我之前测试过上传10秒参考视频,生成416×736分辨率的视频后再放大1.35倍,耗时超过40分钟。
因此,建议上传的参考视频时长尽量控制在5秒以内;若超过5秒,则建议降低生成分辨率或缩短生成时长。
另外,视频参考还有两种隐藏用法:第一种是人物替换。
可将视频中的人物替换为参考图中的人物,并保留原视频场景。
可迁移参考视频中的人物动作,并保留参考图中的人物和场景。
最后补充一点:整合包生成视频的默认帧速率为24fps,因此建议上传的参考视频也使用相同的帧速率。
好了,今天要分享的内容就到这里,想要整合包的鹿友
后台撩我
获取。