Mac Studio M1 Ultra部署Qwen3.5多款MLX&GGUF模型实测性能对比
HEKI_Studio
编辑于 2026年03月05日 00:04

最近拿出了吃灰许久的mac studio想让它作为我的家庭服务器,一个核心功能就是本地部署llm服务给lobehub和一些app用,这样家庭成员都能通过tailscale来远程访问家里的服务器了(关于这个极简的家庭server教程以后出)。之前在自己笔记本上一直用ollama部署小模型当玩具,这次打算认真一次,看看怎么能榨干这台m1u+64g统一内存的性能。

在大模型选项方面,一开始考虑glm-flash-4.7和gpt-oss 20B,随后马上出了qwen3.5系列,好模型太多了不知道怎么选哪个最快,而且这时候又发现网上的性能对比资料很少,有的也很过时,于是决定自己上手测试一下。

Ollama vs LM Studio

首先是平台方面,ollama我很熟悉,但网上查资料发现它不支持mlx,虽然我没用过mlx但一看是苹果做的那岂不是得mac优化的很好?于是我又下载了lm studio,但本着探索的精神,我觉得先实际测试一下比较好,首先在ollama里下载了ollama官方的glm-4.7-flash、qwen3.5-27B、gpt-oss20B和Gemma3-4B(这个是用来做话题命名这类任务的,越小越好),qwen3.5-35b-a3b这个看网上很多人说不如27b这个dense的就没考虑了(其实是想省硬盘),然后在lm studio里又下了staff pick的对应的几个模型(qwen3.5-27B是unsloth的),一共下了几百个g,测试都是用:

从1数到100,结果里不要包含任何其他的字

这句prompt,期间都保证内存中只加载了一个模型,ollama的网站里很多模型都没有说明量化精度和版本,看文件体积应该都是4bit的GGUF,因为当时没想着会发贴,就做了个简单的文字记录,用ai帮我转换成表格:

刚测完很迷惑,qwen3.5-27B的mlx版本跑的比gguf快了一倍,但到gpt和glm4.7flash这块就更慢了,有点玄学,但是大部分结果还是lm studio更快的。这时候有人可能会觉得我这个测试太不客观了,测试的模型可能都不是一样的,于是我又用lm studio下了一堆gguf模型,并在每个模型文件夹里创建了ollama的modelfile来直接在ollama里导入,这部分测试结果没记录,因为两者结果速度基本一毛一样,于是乎我选择卸载羊驼,选择支持mlx和gui操作更方便的lm studio,而且lm studio现在也支持并发和cli了,貌似没有不如ollama的点了?(如有请网友补充指正,还有lm studio官方请打下广告费)

MLX、GGUF模型多尺寸、多量化精度速度对比

在lm studio里又下载了一堆模型,这次补充了Qwen3.5-9B和4B,直接上实测结果:

所有测试全部基于lm studio里的默认参数,主观感受比较明显的就是qwen3.5的思考输出很长很啰嗦,一直反复确认我给的问题有没有隐含意思_(:з」∠)_,之后研究一下怎么降低思考。后续应该还是会测一下Qwen3.5-35B-A3B这个,大家如有新的实测结果,欢迎在评论区分享!