免费大模型,哪个最聪明?我拿难题排了个座次
乔氪智造
2026年08月05日 20:16

横评薅了哪个能用,薅羊毛薅了能薅多少,今天薅最实在的一个:既然都免费,那哪个最聪明?

薅之前总得知道该薅谁。我拿了几道能拉开差距的难题,真调各家免费大模型,排了个座次。都是有唯一正解、但一不小心就掉坑的推理题。

先看结果。

拿满分的是三个:Kimi K3、Cerebras 的 oss-120b、Groq 的 oss-120b。三道推理题全对,一道没栽。要干需要动脑子的活,薅这三个里的一个,靠谱。

有意思的是垫底那个,正是大家最爱薅的 GLM-4-Flash。它是薅羊毛之王,不限流、永久免费,前几篇我都推荐拿它当主力。可一到推理题,它三道错两道。

第一道题:Sally 有 3 个兄弟,每个兄弟都有 2 个姐妹,问 Sally 有几个姐妹?正解是 1,家里就俩女孩,Sally 和她一个姐妹。GLM-4-Flash 一通绕,绕出个 4 来。Kimi K3、Cerebras、Groq、Gemini 都稳稳答 1。

第三道题:5 台机器 5 分钟做 5 个零件,100 台机器做 100 个零件要几分钟?正解 5 分钟,每台 5 分钟一个,100 台同时做,还是 5 分钟。这题是个直觉陷阱,GLM-4-Flash 答了 1 分钟,Gemini 答了 100 分钟,俩都栽了。会推理的 Kimi K3,还有 Cerebras、Groq,都答对 5 分钟。

把这几篇的实测串起来,GLM-4-Flash 这个「薅羊毛之王」的完整画像就出来了:它最能薅(不限流、永久免费),但也最不能全信(爱瞎编、推理最弱)。便宜有便宜的道理。

反过来 Kimi K3,能力座次第一,上一篇测幻觉它也是唯一没瞎编的,但它慢,还有免费窗口随时会关的风险。

所以薅免费大模型,别一个薅到黑,得看活分:

无脑、高频的活,翻译个短句、改个格式、跑个批量,用 GLM-4-Flash 敞开薅,反正简单,它不限流,你薅个够。

要动脑子、要推理、要它给准信的活,别用那些又快又便宜的,GLM-4-Flash、Gemini Flash-Lite 这种轻量版最容易翻车;薅 Kimi K3 或者 Cerebras、Groq 这种舍得算力的,聪明、不瞎编,代价是慢一点、或者有限流。

免费这一层,「快」和「聪明」常常不可兼得。摸清哪个聪明、哪个快、哪个能敞开薅,按活派对人,你才薅得又多又准。