配置:Windows、RTX 5080 16GB 显存、32GB DDR4,ComfyUI + MiniMax H3 Director。
先说能不能跑:16GB 显存可以,但必须用量化权重,别去碰全精度。32GB 内存够用,页面文件建议开到 48–64GB。磁盘至少空出 60GB——全部权重加起来 63GB,只跑文生视频的话 42GB。
参数不用自己摸,从这一组开始:
864×480 / 24fps / 124 帧(约 5.17 秒)/ 25 steps / res_multistep / simple / CFG 1.0 / video shift 12 / audio shift 3
一、下权重
官方仓库:Comfy-Org/MiniMax-H3
- fl2va 文生/图生 UNET,20.97GB →
models/diffusion_models/ - ref2va 参考图/视频 UNET,20.97GB →
models/diffusion_models/ - Qwen3-VL 文本编码器,15.69GB →
models/text_encoders/ - 视频 VAE,4.85GB →
models/vae/ - 音频 VAE,577MB →
models/vae/
只想先跑通文生视频的话,fl2va + 文本编码器 + 两个 VAE 就够了。ref2va 是做参考图/参考视频时才用,可以晚点再下。
顺带提一句:Hugging Face token 别写进工作流,也别贴到文章里。
二、装
1. 驱动和目录。 装好 RTX 5080 驱动,终端跑一下 nvidia-smi 确认认得到卡。我用的目录是 D:\minimax-h3\ComfyUI,先把 models/diffusion_models、models/text_encoders、models/vae 和 custom_nodes 建出来。
2. 先让 ComfyUI 空跑一次。 按官方 Windows 方式装完,然后:
cd D:\minimax-h3\ComfyUI
.\.venv\Scripts\python.exe main.py --listen 127.0.0.1 --port 8188
浏览器能打开页面,就说明底座没问题,退出。
3. 装 Director。 ComfyUI Manager 里搜 ComfyUI_MiniMaxH3_Director,或者手动:
cd D:\minimax-h3
git clone https://github.com/AIMixer/ComfyUI_MiniMaxH3_Director.git .\ComfyUI\custom_nodes\ComfyUI_MiniMaxH3_Director
.\ComfyUI\.venv\Scripts\python.exe -m pip install -r .\ComfyUI\custom_nodes\ComfyUI_MiniMaxH3_Director\requirements.txt
4. 放权重。 按上面的目标目录复制,文件名别改,然后重启 ComfyUI。
5. 导工作流。 下载 T2V 工作流 JSON 拖进去。UNET 选 fl2va;CLIP 选 Qwen3-VL,类型要选 minimax;两个 VAE 分别对应视频和音频,别接反。
6. 填参数。 就是开头那一组,接好 CreateVideo 和 SaveVideo。
7. 跑第一条。 用这个短 prompt,点 Queue Prompt,然后确认导出的 MP4 里画面和声音都有:
Realistic live-action cinematic shot of a quiet modern room at sunrise, soft natural light, subtle room ambience, no text, no watermark, no non-diegetic music.
三、想串成一段完整故事
单段控制在 5 秒左右,一段只安排一个主要动作,贪多必崩。
做法是:生成上一段之后提取尾帧,当作下一段 I2V 的首帧,提示词里用 <Picture 1> 引用它。人物服装、天气、车辆颜色、左右位置关系这些要在每段提示词里反复锁定,不然它会自己漂。
字幕和 BGM 都留到后期:字幕后期压制,BGM 统一加,片段之间做交叉淡化。
若无法加载请检查网络环境。
若无法加载请检查网络环境,或切回 Disqus 稍后再试。