先说结论
经过四轮实测,我的RTX 4060笔记本8G显存,用GGUF模型跑zimage工作流,生成两张1024x640图片,10步采样。
• 主模型:z_image_turbo-Q6_K.gguf(5.7 GB,Q6_K量化等级)
• 文本编码器:Qwen3-4B-Q4_K_M.gguf(2.4 GB,Q4_K_M量化等级)
• 工作流:一次性生成两张 1024×640 图片,采样步数10步
最佳启动参数只有一条:--bf16-vae
配合Sage Attention,72秒出图,显存只占2.8G,CPU压力最低。
其他那些网上流传的参数,要么没用,要么反而更慢。
我测了四组参数
第一组:加--fp16-unet和文本FP8 结果:76秒,显存2.8G
第二组:加--fp8_e4m3fn-unet和文本FP8 结果:85秒,显存直接翻倍到5.2G,速度最慢
第三组:只加文本FP8 结果:72.19秒,显存2.8G,速度最快
第四组:只加--bf16-vae 结果:72.22秒,显存2.8G,CPU压力最低
第三组和第四组几乎一样快,但第四组CPU更稳。
几个反直觉的发现
第一,FP8参数千万别加
网上说40系显卡用--fp8_e4m3fn-unet能快两倍,显存再省25%。
实测恰恰相反,速度慢了18%,显存翻倍。
为什么?因为GGUF模型会被强制从FP8转回BF16计算,两份精度同时占显存,反而更慢更吃显存。
第二,--fp16-unet加了等于没加
GGUF模型自带显存管理,根本不听这个参数。你加不加,它都按自己的方式加载。
第三,文本编码器精度不用纠结
FP16还是BF16,时间只差0.03秒,显存完全一样。不是瓶颈,不用管。
第四,Sage Attention比xFormers更适合我
xFormers省显存但慢,Sage Attention速度快。我8G显存用GGUF模型后显存已经很充裕(只占2.8G),所以选速度快的。
我现在用的启动命令
bash
--use-sage-attention
--disable-async-offload
--disable-pinned-memory
--disable-smart-memory
--disable-cuda-malloc
--disable-mmap
--disable-xformers
--normalvram
--bf16-vae
核心思路:稳定第一,速度第二,拒绝无效参数
大量--disable-*是为了防止闪退,笔记本8G显存跑大模型本来就边缘,稳定比什么都重要。
几个客观规律总结
规律一:GGUF模型是自动驾驶
它自己管显存、自己决定精度,不需要你加--lowvram、--fp16-unet这些参数。加了也没用。
规律二:FP8参数只对原生FP8模型有效
用在GGUF上就是灾难,会触发精度转换,显存翻倍,速度变慢。
规律三:启动参数不是越多越好
很多网上流传的优化参数,针对的是原生模型。你用GGUF的话,大多数都是多余的,甚至起反作用。
规律四:CPU/内存大小)也是瓶颈
我四轮测试CPU使用率都在90%以上,说明CPU预处理已经拖后腿了。启动参数调到这份上,再想提速就该优化工作流本身了,比如减少预览节点、合并ControlNet预处理。
给同样用GGUF模型的你几点建议
建议一:起步配置只用--bf16-vae
其他精度参数先别加,跑起来再说。
建议二:别碰FP8 UNet参数
这是本次测试最大的坑,加了必翻车。
建议三:显存够用就选速度快的注意力机制
Sage Attention或Flash Attention优先,xFormers是显存实在不够时的备选。
建议四:如果爆显存,换更低位的GGUF文件
从Q6_K降到Q5_K_M或Q4_K_M,别去堆显存管理参数。
建议五:笔记本用户多加点稳定参数
--disable-*系列虽然看起来像是“关掉优化”,但实际上能避免很多莫名其妙的闪退。稳定比那一点点性能提升重要。