
這次真的自己裝、自己跑、自己測。
最近看到有人分享,M5 Pro 跑 Qwen3.8-27B + DFlash2 可以衝到 25 tok/s 以上,所以我直接拿自己的 M5 Pro 64GB 實測看看。
結果很有意思:
寫程式碼 13.2 → 42.3 tok/s 直接來到 3.2× 加速
但是換成一般中文問答:
聊天/中文問答 8.0 → 8.2 tok/s 幾乎完全沒差。
原因其實就在 DFlash2 的運作方式。
它會先讓一個草稿模型「猜」後面會產生什麼 token,再由主模型驗證。
寫 code 的時候,因為 if / else / for / def 這些結構高度規律、重複性高,所以非常容易猜中,一次可以接受很多 token,速度自然就衝上去了。
但聊天、寫文案、創作這類任務,每一句都可能完全不同,草稿模型猜不中,驗證成本又還是在,所以加速效果幾乎消失。
我自己的比喻是:
寫 code = 照著食譜做菜 下一步通常猜得到。
聊天 = 聽你說夢話 下一句根本不知道你要講什麼。😂
所以網路上看到「20、30、甚至 40 tok/s」,真的要先看清楚測的是什麼任務。
以我自己的使用方式來說,我平常本機 AI 比較常拿來聊天、創作、寫文案,那 DFlash2 對我的幫助就很有限。
但如果你主要是拿本機模型來寫程式,那這個加速就真的很有感。
結論:不是模型跑得快就代表所有任務都快。

#LocalLLM #Qwen #Qwen3 #DFlash2 #MLX #AppleSilicon #M5Pro #AI #本機AI #LocalAI