minimax-h3是MiniMax 的通用全模态生成模型,现已开源。它支持多种语言,反正中英文可以,然后能够在一个统一的上下文中同时理解文本,图像,视频和音频,并生成带有声音的视频,换句话说: 它可以当TTS,也可以用一帧输出当图像编辑模型,甚至还能当个音乐生成模型。 全看怎么去用它。 这个模型可以说是非常强大的同时,也非常的大。comfyui提供的int8模型,就有差不多20G,看来,绝大多数电脑是跑不了~ 但是,comfyui通过采取以时间换空间的策略,通过压榨SSD固态的潜力,从而让模型可以在8G显存的显卡的电脑上跑起来。 虽然时间有点长(是真的有点长) 但是好歹能跑对吧? 当然,这种问题对大显存用户来说不是问题,例如96G显存的啊,48G显存的啊... 那么这么强大的模型该怎么去使用它呢? 方法倒是很简单: 1.更新comfyui,同时更新它的这几个库:
comfyui-frontend-package,comfyui-manager,comfyui-frontend-package,comfyui-embedded-docs,comfy-aimdo,comfy-kitchen
同学也可以直接去github下载官方整合包或者桌面版。
如果缺少ComfyMathExpression,
去这里下载即可: ComfyMath
然后下载模型:
编码器: https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
(放在:ComfyUI/models/text_encoders/)
模型本体:
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors
(放在:ComfyUI/models/diffusion_models/)
参考模型:
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors
视频VAE:
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_video_vae_fp16.safetensors
(放在:ComfyUI/models/vae/)
音频VAE:
https://huggingface.co/Comfy-Org/MiniMax-H3/blob/main/vae/minimax_h3_audio_vae_fp32.safetensors
(放在:ComfyUI/models/vae/)
然后下载工作流:
然后导入节点,一般就可以直接用了。
具体的生成时间的话,要有一个较长时间的心理准备。
反正探客2080ti 22G生成5秒,448*448的视频需要差不多8分钟,不过其实比当初WAN2.2要快,当初我记得直接跑了16分钟。
当然,加速的方法很多,反正是八仙过海各显神通,
探客用的是LightX Minimax H3 Turbo LORA
这个是4步LORA,可以提速5倍,当然质量会下降,可以等成熟之后再用。
用这个lora的时间探客的魔改2080ti只需要不到2分钟,嗯,非常强大(话说用wan2.2的4步lora也需要差不多这么久,但是质量不如这个)
当然现在还是初版: https://huggingface.co/lightx2v/Minimax-h3-Turbo/tree/main
虽然生成时间长,但是质量是真的高,前任王者wan2.2现在除了速度相对快一点点,lora多,优势基本没多少了。 毕竟这个质量高,还同时能生成音频,缺点也就是速度慢一点点(实际上也没慢多少),但是无所谓啊,追求速度可以直接低分辨率生成然后随便弄个超分辨率模型超分一下,想要耐心等1-2个小时直出高分辨率视频也可以。只能说开源王者的宝座易主是很快的。