几个 Coder 大模型本地部署推理速度测试
计算学徒
2026年05月05日 22:16
收录于文集
共20篇
AI大模型

最近在研究使用大模型辅助软件开发和代码生成,顺带测试一下使用我的笔记本电脑部署本地大模型的推理速度。

笔记本的配置基本情况如下:

  • CPU:Intel i7-12700H

  • 内存:DDR5 4800MHz 32G+16G

  • 显卡:Nvidia T600 4G

测试了几个专用于 Coder 的大模型,使用 ollama 运行,提示词为:“请使用python生成一个快速排序的算法函数,要求在排序过程中不创建新的临时数组”,推理速度结果分别如下:

  • deepseek-coder-v2:16b 推理速度:26.38 tokens/s

  • qwen3-coder:30b 推理速度:15.99 tokens/s

  • nemotron-cascade-2:30b 推理速度:10.16 tokens/s

  • phi4:14b 推理速度:3.62 tokens/s

  • qwen2.5-coder:14b 推理速度:3.29 tokens/s

  • glm-4.7-flash:30b 推理速度:6.68 tokens/s

除了推理速度存在较大差异,各大模型生成的最终内容长度也各不相同,分别为:

  • deepseek-coder-v2:16b 生成内容长度:362 token(s)

  • qwen3-coder:30b 生成内容长度:972 token(s)

  • nemotron-cascade-2:30b 生成内容长度:4405 token(s)

  • phi4:14b 生成内容长度:593 token(s)

  • qwen2.5-coder:14b 生成内容长度:371 token(s)

  • glm-4.7-flash:30b 生成内容长度:2603 token(s)

在这几个大模型中,deepseek-coder-v2:16b 是推理速度最快,但是生成内容长度最短(代码质量最低?)。nemotron-cascade-2:30b 和 glm-4.7-flash:30b 两个模型生成内容长度(代码质量)最高,但是推理时长太长。对比之下,qwen3-coder:30b 的推理速度勉强可以接受,生成内容长度适中,总得推理时长可以接受,实用性最强。

#大模型#​ #qwen3-coder#​ #deepseek-coder-v2#​ #nemotron-cascade-2#​ #phi4#​ #qwen2.5-coder#​ #glm-4.7-flash#​ #推理速度#​ #ollama#​

(完)