本期视频用 V100 显卡,实测 Qwen3.6 系列两个大模型——35B 和 27B 的输出生成速度。
测试环境:
GPU:NVIDIA Tesla V100 16G
推理框架:llama.cpp / LM Studio
量化方式:GGUF I-Compact / IQ4_XS
数据速览:
00:00 - 开场白
00:09 - Qwen3.6 27B 速度实测 (LM Studio)
00:45 - Qwen3.6 35B 速度实测 (LM Studio)
01:35 - Qwen3.6 35B 速度实测 (llama.cpp)
01:55 - 结尾
结论:
Qwen3.6 27B 生成速度约为 15 tokens/s
Qwen3.6 35B 生成速度约为 45 tokens/s
如果本期对你有帮助,希望你不吝三连支持一下哦!更欢迎大家在评论区给出优化建议!