穷玩:V100 跑 Qwen3.6 35B/27B 模型推理速度实测

1.2万
3
2026-05-20 21:14:19
个人观点,仅供参考
79
6
128
6
本期视频用 V100 显卡,实测 Qwen3.6 系列两个大模型——35B 和 27B 的输出生成速度。 测试环境: GPU:NVIDIA Tesla V100 16G  推理框架:llama.cpp / LM Studio 量化方式:GGUF I-Compact / IQ4_XS 数据速览: 00:00 - 开场白 00:09 - Qwen3.6 27B 速度实测 (LM Studio) 00:45 - Qwen3.6 35B 速度实测 (LM Studio) 01:35 - Qwen3.6 35B 速度实测 (llama.cpp) 01:55 - 结尾 结论: Qwen3.6 27B 生成速度约为 15 tokens/s Qwen3.6 35B 生成速度约为 45 tokens/s 如果本期对你有帮助,希望你不吝三连支持一下哦!更欢迎大家在评论区给出优化建议!
30岁不上班宅男觉得最好的休息方式是多睡觉。
客服
顶部
赛事库 课堂 2021拜年纪