最近在研究使用大模型辅助软件开发和代码生成,顺带测试一下使用我的笔记本电脑部署本地大模型的推理速度。
笔记本的配置基本情况如下:
CPU:Intel i7-12700H
内存:DDR5 4800MHz 32G+16G
显卡:Nvidia T600 4G
测试了几个专用于 Coder 的大模型,使用 ollama 运行,提示词为:“请使用python生成一个快速排序的算法函数,要求在排序过程中不创建新的临时数组”,推理速度结果分别如下:
deepseek-coder-v2:16b 推理速度:26.38 tokens/s
qwen3-coder:30b 推理速度:15.99 tokens/s
nemotron-cascade-2:30b 推理速度:10.16 tokens/s
phi4:14b 推理速度:3.62 tokens/s
qwen2.5-coder:14b 推理速度:3.29 tokens/s
glm-4.7-flash:30b 推理速度:6.68 tokens/s
除了推理速度存在较大差异,各大模型生成的最终内容长度也各不相同,分别为:
deepseek-coder-v2:16b 生成内容长度:362 token(s)
qwen3-coder:30b 生成内容长度:972 token(s)
nemotron-cascade-2:30b 生成内容长度:4405 token(s)
phi4:14b 生成内容长度:593 token(s)
qwen2.5-coder:14b 生成内容长度:371 token(s)
glm-4.7-flash:30b 生成内容长度:2603 token(s)
在这几个大模型中,deepseek-coder-v2:16b 是推理速度最快,但是生成内容长度最短(代码质量最低?)。nemotron-cascade-2:30b 和 glm-4.7-flash:30b 两个模型生成内容长度(代码质量)最高,但是推理时长太长。对比之下,qwen3-coder:30b 的推理速度勉强可以接受,生成内容长度适中,总得推理时长可以接受,实用性最强。
#大模型# #qwen3-coder# #deepseek-coder-v2# #nemotron-cascade-2# #phi4# #qwen2.5-coder# #glm-4.7-flash# #推理速度# #ollama#
(完)