
在 Blackdevice 团队,我们一直在挖掘小型硬件平台的性能极限。本次测试采用自研 Pi Hack 载板搭配 8GB 内存树莓派计算模块 5(CM5),并搭载 256GB NVMe 固态硬盘。

本次测试目标很明确:部署 Ollama 工具,运行多款轻量化本地大语言模型(LLM),使用相同提示词对比各模型的实际表现。 本地离线运行大模型的优势十分诱人:数据隐私可控、全程离线使用、模型完全自主掌控。但在硬件资源受限的设备上,这份优势能否转化为流畅、实用的真实使用体验?先剧透结论:部分模型表现出色,还有不少模型实用性极差。本文会完整讲解部署流程、测试方案、各模型实测性能数据,以及我们实际体验后对每款模型的总结评价。
Ollama 是一款命令行驱动的本地大模型运行工具。无需调用云端 API,可直接将模型下载至本地设备(ollama.com/search),通过终端与模型交互。对于本次测试流程,它具备两大优势:
所有数据本地存储、全程离线运行;
模型下载、加载、推理全过程透明可观测。
本次使用的 Pi Hack 载板尚处于实验阶段,Ollama 非常适合在此设备上快速开展可控的模型对比测试。
所用硬件
Pi Hack 树莓派 CM5 专用载板
树莓派计算模块 5(CM5),8GB 内存
256GB M.2 接口 NVMe 固态硬盘
以太网供电模块(PoE),同时提供网络与设备供电
磁盘系统烧录步骤
使用 rpi-boot 工具,将设备 eMMC 闪存 / NVMe 硬盘映射为主机可识别的外置存储设备;
打开树莓派镜像烧录工具,将 64 位树莓派官方系统烧录至 NVMe 固态硬盘,使设备从固态硬盘启动。
首次开机配置
连接显示器、键盘与 PoE 供电网线,完成首次启动;
开机后获取设备局域网 IP,通过电脑 SSH 远程连接设备。
依次执行以下终端命令:
1.更新系统并安装基础依赖工具
sudo apt update && sudo apt upgrade -ysudo apt install -y curl wget jq git ca-certificates 2.安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh 3.验证 Ollama 安装与后台服务状态
ollama --versionsudo systemctl status ollama 为公平对比各模型性能,我们制定一套标准化、可复现的测试流程。所有模型使用完全相同的提示词,运行时开启--verbose详细日志模式,采集完整性能统计数据。
提示词 1(翻译任务):将以下西班牙语句子翻译成英文:Probar modelos de inteligencia artificial en local nos permite compararlos y comprobar el rendimiento en diferentes dispositivos.
提示词 2(历史梳理任务):选出三项科学史上里程碑事件,按从远古到近代的顺序排列。
两类任务能直观区分模型能力差异:基础语义理解、文本结构化输出、文字生成速度。所有模型均在完全相同的硬件环境(8GB 内存 CM5+NVMe 固态)下载并运行,任务难度适配轻量化小模型。
本次通过 Ollama 测试多款轻量化开源大模型:
TinyLlama 1.1B
Deepseek R1 — 1.5B, 7B and 8B
Gemma3 — 270M, 1B and 4B
Phi-4 mini reasoning — 3.8B

针对每一组测试样本,我们均使用两种提示词进行运行,并对生成结果与原始性能指标展开分析。
以下为参与测试的模型,以及实际执行时所用的完整运行命令:
tinyllama (TinyLlama 1.1b) — ollama run tinyllama:1.1b --verbose
deepseek-r1:1.5b — ollama run deepseek-r1:1.5b --verbose
deepseek-r1:7b — ollama run deepseek-r1:7b --verbose
deepseek-r1:8b — ollama run deepseek-r1:8b --verbose
gemma3:270m, gemma3:1b, gemma3:4b — ollama run gemma3:<size> --verbose
phi4-mini-reasoning:3.8b — ollama run phi4-mini-reasoning:3.8b --verbose

Deepseek R1: 1.5B
输出质量:生成速度快,但文本质量差。翻译任务中将西班牙语 “en local(本地)” 错误理解为地理地点;历史里程碑任务给出的事件不准确,时间顺序、年份均存在错误。
提示词 1 性能数据:
总耗时:25.00 秒
模型加载耗时:222.91 毫秒
提示词 token 总量:40 个,提示词推理耗时 1.87 秒,吞吐 21.37 token / 秒
生成 token 总量:261 个,生成耗时 22.60 秒,吞吐 11.54 token / 秒
提示词 2 性能数据:
总耗时:58.653 秒
模型加载耗时:208.187 毫秒
提示词 token 总量:23 个,提示词推理耗时 0.992 秒,吞吐 23.17 token / 秒
生成 token 总量:641 个,生成耗时 56.703 秒,吞吐 11.30 token / 秒
总结:尽管生成速度尚可,但内容准确度不足,无法投入实际使用。
Deepseek R1: 7B
输出质量:生成速度大幅变慢,回答逻辑混乱、错误较多。模型会出现大量无意义循环推理,输出质量完全无法匹配过长的等待时间。
提示词 1 性能数据:
总耗时:2 分 9.477 秒(约 129.48 秒)
模型加载耗时:227.324 毫秒
提示词 token 总量:40 个,提示词推理耗时 8.961 秒,吞吐 4.46 token / 秒
生成 token 总量:294 个,生成耗时 1 分 59.887 秒,吞吐 2.45 token / 秒
提示词 2 性能数据:
总耗时:11 分 7.088 秒(约 667.09 秒)
模型加载耗时:224.595 毫秒
提示词 token 总量:23 个,提示词推理耗时 4.734 秒,吞吐 4.86 token / 秒
生成 token 总量:1473 个,生成耗时 11 分 0.373 秒,吞吐 2.23 token / 秒
总结:在 8GB 内存 CM5 设备上运行速度过慢,耗时与输出质量严重失衡。
Deepseek R1: 8B
输出质量:输出内容比 7B 版本更好,但运行速度依旧极慢;回答结果勉强可用,但等待成本过高,实用性很低。
提示词 1 性能数据:
总耗时:2 分 35.038 秒(约 155.04 秒)
模型加载耗时:252.184 毫秒
提示词 token 总量:39 个,提示词推理耗时 9.297 秒,吞吐 4.19 token / 秒
生成 token 总量:295 个,生成耗时 2 分 25.208 秒,吞吐 2.03 token / 秒
提示词 2 性能数据:
总耗时:6 分 42.290 秒(约 402.29 秒)
模型加载耗时:216.430 毫秒
提示词 token 总量:21 个,提示词推理耗时 4.802 秒,吞吐 4.37 token / 秒
生成 token 总量:769 个,生成耗时 6 分 36.656 秒,吞吐 1.94 token / 秒
总结:运行缓慢;虽然能在设备上启动,但实用性勉强达标。相比小参数量 Deepseek 模型输出有提升,但时间成本过高,综合表现一般。
Gemma3: 270M
输出质量:速度极快,翻译直译准确,足以应对极简任务,在 CM5 上运行表现极佳。
提示词 1 性能数据:
总耗时:1.416 秒
模型加载耗时:264.957 毫秒
提示词 token 总量:40 个,提示词推理耗时 0.161 秒,吞吐约 248.5 token / 秒
生成 token 总量:24 个,生成耗时 0.898 秒,吞吐约 26.7 token / 秒
提示词 2 性能数据:
总耗时:12.205 秒
模型加载耗时:258.755 毫秒
提示词 token 总量:28 个,提示词推理耗时 0.104 秒,吞吐约 269.0 token / 秒
生成 token 总量:284 个,生成耗时 11.295 秒,吞吐约 25.1 token / 秒
总结:极小参数量模型中吞吐能力顶尖,回答结果可用,适合简单场景。
Gemma3: 1B
输出质量:同参数量级里输出质量优秀;翻译任务会给出多版译文并附带推荐,生成速度与内容丰富度平衡出色。
提示词 1 性能数据:
总耗时:15.083 秒
模型加载耗时:529.896 毫秒
提示词 token 总量:40 个,提示词推理耗时 1.293 秒,吞吐 30.92 token / 秒
生成 token 总量:151 个,生成耗时 13.048 秒,吞吐 11.57 token / 秒
提示词 2 性能数据:
总耗时:52.409 秒
模型加载耗时:551.967 毫秒
提示词 token 总量:27 个,提示词推理耗时 0.767 秒,吞吐 35.21 token / 秒
生成 token 总量:563 个,生成耗时 49.811 秒,吞吐 11.30 token / 秒
总结:CM5 设备综合表现最优模型,输出质量高,延迟可接受,适配绝大多数本地轻量化需求。
Gemma3: 4B
输出质量:速度慢于 1B 版本,但回答细节更丰富;针对本次测试的简单提示词,1B 版本完全够用且响应更快,4B 模型加载、生成耗时显著增加。
提示词 1 性能数据:
总耗时:1 分 10.156 秒(约 70.16 秒)
模型加载耗时:536.921 毫秒
提示词 token 总量:40 个,提示词推理耗时 4.529 秒,吞吐 8.83 token / 秒
生成 token 总量:251 个,生成耗时 1 分 4.728 秒,吞吐 3.88 token / 秒
提示词 2 性能数据:
总耗时:2 分 53.720 秒(约 173.72 秒)
模型加载耗时:537.524 毫秒
提示词 token 总量:28 个,提示词推理耗时 2.750 秒,吞吐 10.18 token / 秒
生成 token 总量:639 个,生成耗时 2 分 49.515 秒,吞吐 3.77 token / 秒
总结:输出质量良好,但针对简单任务算力冗余;1B 版本是综合性价比最优选择。
TinyLlama: 1.1B
输出质量:生成速度快,但输出不稳定。一次翻译任务出现明显错误,历史事件梳理内容准确度低。性能略优于小参数量 Deepseek R1,但整体弱于 Gemma3 系列。
提示词 1 性能数据:
总耗时:5.285 秒
模型加载耗时:83.223 毫秒
提示词 token 总量:77 个,提示词推理耗时 2.880 秒,吞吐 26.73 token / 秒
生成 token 总量:39 个,生成耗时 2.298 秒,吞吐 16.97 token / 秒
提示词 2 性能数据:
总耗时:15.123 秒
模型加载耗时:93.980 毫秒
提示词 token 总量:57 个,提示词推理耗时 1.240 秒,吞吐 45.95 token / 秒
生成 token 总量:244 个,生成耗时 13.706 秒,吞吐 17.80 token / 秒
总结:响应速度快,但输出内容杂乱、错误较多,无法稳定可靠使用。
Phi-4 mini reasoning: 3.8B
输出质量:模型擅长深度推理,但运行速度极慢;针对本次简单任务会产生大量无效推理循环(第二条提示词尤为明显)。最终答案虽可能正确,但等待时间完全无法接受。
提示词 1 性能数据:
总耗时:2 分 32.606 秒(约 152.61 秒)
模型加载耗时:277.632 毫秒
提示词 token 总量:48 个,提示词推理耗时 5.185 秒,吞吐 9.26 token / 秒
生成 token 总量:453 个,生成耗时 2 分 26.460 秒,吞吐 3.09 token / 秒
提示词 2 性能数据:
总耗时:10 分 38.034 秒(约 638.03 秒)
模型加载耗时:267.611 毫秒
提示词 token 总量:36 个,提示词推理耗时 2.339 秒,吞吐 15.39 token / 秒
生成 token 总量:1783 个,生成耗时 10 分 32.768 秒,吞吐 2.82 token / 秒
总结:在 8GB 内存 CM5 上处理此类简单任务完全不具备实用性。
本文测试了多款轻量化大语言模型在原生不面向 AI 算力场景的嵌入式硬件上的运行表现。测试结论十分清晰:所有模型均可正常启动运行,但 Gemma3 系列的运行速度与资源效率远超预期。 在极简嵌入式硬件本地部署大模型,能直观看清各模型真实运行表现、性能上限,以及在小型嵌入式设备上的实际落地价值。
本次测试也为后续硬件横向对比建立基准。后续我们会在不同设备上使用相同模型、相同提示词复现测试,客观评估新款硬件性能,统一衡量不同平台在同等测试条件下的真实算力水平。
联系UP加入树莓派交流群!
Tip:对于刚接触树莓派的新手来说,面对英文文档、零散教程和复杂配置,很容易无从下手。pidoc.cn( https://pidoc.cn/ )就是为解决这些痛点而生的树莓派中文一站式学习平台,界面清晰、内容系统、更新及时,堪称新手入门的“保姆级” 网站,让零基础用户也能轻松上手树莓派。

ED-CLAWBOX 是一款基于 Raspberry Pi CM5 的工业级 AI 智能体盒子,专为 OpenClaw 端侧私有化部署而设计。官方网站:https://edatec.cn/zh/clawbox

低成本,低功耗,紧凑型邮票孔封装计算模块,用最低的价格,享受整个树莓派生态和社区!官方网站:https://edatec.cn/zh/cm0