LTXV,自初登场就主打一个体积小,速度快,
前面几代版本体积的确小,速度的确很快,但是质量也是真的差。
随着开发团队继续捣鼓,LTXV终究走向了大模型之路,
这次推出的LTX 2,体积高达19B(190亿参数),官方给出的NVFP4量化高达20GB,
推荐显存占用直接来到了32GB,不过速度依旧很快,支持I2V,T2V,首尾帧,视频续播,深度控制...而且还能生成音频,是一个很大的突破了。
而且还支持长达35S的视频,可以说很有潜力。
(官方:LTX-2 支持最长 10 秒的带同步音频的连续录制时长更长的片段。不过社区用户弄到了35秒)
但是我们广大同学中,没几个用得起RTX PRO 6000的,
别说这个显卡了,5090,4090又有多少人用得起呢?
绝大多数用户能有16G显存就不错了。
(同学A:我只有手机,能运行吗?)
(同学B:我的RTX 960能上吗?)
(同学C:我的显存高达4G,内存高达8G,能上吗?)
以上同学先不要绝望,虽然的确也没多大希望。
但是万一GGUF出了Q2,Q1量化呢?说不准就能跑了。
那么据社区用户初次体验来说,即便是5090也难以承担如此庞大的模型。
难道说要重演FLUX 2的悲剧了吗?
然而并非如此,
根据社区用户的使用情况来看,有人直接改了comfyui的代码: ComfyUI\comfy\ldm\lightricks\embeddings_connector.py
修改以下代码
hidden_states = torch.cat((hidden_states, learnable_registers[hidden_states.shape[1]:].unsqueeze(0).repeat(hidden_states.shape[0], 1, 1)), dim=1)
为
hidden_states = torch.cat((hidden_states, learnable_registers[hidden_states.shape[1]:].unsqueeze(0).repeat(hidden_states.shape[0], 1, 1).to(hidden_states.device)), dim=1)
这让4090在8步精简版模型上可以近乎实时的处理,速度非常之快。
还有人简单的在启动脚本上添加--novram参数。
将模型卸载到了内存上,启动权重流式传输,这只消耗了3GB显存,并且速度也不慢。
(社区用户分享来看,5080 16G,1分钟可以弄出5秒的视频)
可谓是八仙过海,各显神通。
(之前英伟达和comfyui一起优化了权重流式传输,用于FLUX2,从而显著降低了显存使用,虽然FLUX2也能用这个方法,但是速度会更慢更慢...)
注意:用内存跑的话,内存建议64G,而且96G,128G比较好,
主要是因为出了LTX视频模型,还多了一个谷歌的gemma-3。
当然,目前,我们可以使用unsloth的gemma-3-12b-it-bnb-4bit来降低内存需求,
不过即便如此也需要48GB内存,或者至少内存显存加起来有这么多。
那么既没有多能用的显卡,也只有8G,16G内存的同学们可以先点击右上角,等后续完善看看可不可能了。
至于想要升级内存来玩这个模型的,当前内存那么贵,干脆等几年再看看吧。
说不定很快就出现比LTX2更好的模型了呢~
随着GGUF的支持,模型的显存占用得到了减半式下滑,如今,Q8量化的显存占用是19G,Q4量化的则只需要12G,Q2则是6G,Q1则是3G,没错,3G显存真的能跑,而且不需要流式传输,不过代价就是模型的精度大幅下降,产出的视频质量也变得很低,所以与其用Q1,还是用流式传输用内存跑好些。
GGUF本身也支持用CPU跑,所以也可以考虑显存加内存大小匹配的量化模型.
目前建议的工作流程:https://github.com/Lightricks/ComfyUI-LTXVideo/tree/master/example_workflows
模型下载地址:https://huggingface.co/Lightricks/LTX-2
放入checkpoints文件夹。
其中distilled代表是8步蒸馏版本,lora则是8步蒸馏lora。
upscaler则是超分辨率模型。
我们可以按需下载,探客喜欢速度(速度快,那用CPU都能跑啊),也不想用lora(毕竟原始版加lora比蒸馏版还大 ),所以下载的就是ltx-2-19b-distilled-fp8.safetensors
GGUF版本:https://huggingface.co/Kijai/LTXV2_comfy/tree/main/diffusion_models
按需下载丢进unet文件夹中即可。
gemma3下载地址:https://huggingface.co/unsloth/gemma-3-12b-it-bnb-4bit/tree/main
里面所有的文件全部下载,然后都放入新建的gemma-3-12b-it-bnb-4bit文件夹中。
(喜欢的话也能用它来部署本地的聊天模型,现在用文本生成模型作文本编码器已经是普遍现象了,传统的CLIP已经成为过去了)
把该文件夹丢进clip文件夹里。
GGUF版本:https://huggingface.co/unsloth/gemma-3-12b-it-GGUF/tree/main
更新comfyui到最新版本,安装ltx-video节点包:
https://github.com/Lightricks/ComfyUI-LTXVideo
在启动脚本上添加--novram参数,启动comfyui。
(--reserve-vram 4也是比较常用的,表示预留4GB显存)
(--cache-none --reserve-vram 1 --lowvram则更进一步,只预留1GB显存)
更新KJNODE:https://github.com/kijai/ComfyUI-KJNodes
更新GGUF加载节点:https://github.com/city96/ComfyUI-GGUF
Kija的GGUF节点工作流:https://files.catbox.moe/lx9tyz.json
当然也可以手动修改常规工作流中的模型加载节点为GGUF。
然后拖拽工作流程进入comfyui界面,
使用常规工作流需要将原本的编码器加载节点换成gemma 3 model loader。
GGUF直接换成GGUF的编码器加载节点即可。
步数设置为8,CFG设置为1,开始启动。