Qwen3.8-27B-4bit(16GB)+ DFlash2 草稿模型(3.9GB)
我在行走的路上
2026年08月20日 17:35

這次真的自己裝、自己跑、自己測。

最近看到有人分享,M5 Pro 跑 Qwen3.8-27B + DFlash2 可以衝到 25 tok/s 以上,所以我直接拿自己的 M5 Pro 64GB 實測看看。

結果很有意思:

寫程式碼 13.2 → 42.3 tok/s 直接來到 3.2× 加速

但是換成一般中文問答:

聊天/中文問答 8.0 → 8.2 tok/s 幾乎完全沒差。

原因其實就在 DFlash2 的運作方式。

它會先讓一個草稿模型「猜」後面會產生什麼 token,再由主模型驗證。

寫 code 的時候,因為 if / else / for / def 這些結構高度規律、重複性高,所以非常容易猜中,一次可以接受很多 token,速度自然就衝上去了。

但聊天、寫文案、創作這類任務,每一句都可能完全不同,草稿模型猜不中,驗證成本又還是在,所以加速效果幾乎消失。

我自己的比喻是:

寫 code = 照著食譜做菜 下一步通常猜得到。

聊天 = 聽你說夢話 下一句根本不知道你要講什麼。😂

所以網路上看到「20、30、甚至 40 tok/s」,真的要先看清楚測的是什麼任務。

以我自己的使用方式來說,我平常本機 AI 比較常拿來聊天、創作、寫文案,那 DFlash2 對我的幫助就很有限。

但如果你主要是拿本機模型來寫程式,那這個加速就真的很有感。

結論:不是模型跑得快就代表所有任務都快。

#LocalLLM #Qwen #Qwen3 #DFlash2 #MLX #AppleSilicon #M5Pro #AI #本機AI #LocalAI