极限性能调优llama.cpp在ARM处理器下的LLM推理
知渡小搭
2026年05月22日 14:37
收录于文集
共6篇
meta-llama

受限于 Debian 11 自带的 Glibc/GCC/BinUtils 版本过低,无法用到Arm处理器的高级特性,号称性能提升可观。

借助于 AI 工具,把系统环境都升了一把:

  • binutils: 2.35.2 → 2.46

  • glibc: 2.31 → 2.38

  • gcc: 10.2.1 → 13.2.0

gcc版本

逐步调优,把处理器特性都在 llama.cpp 编译过程中启用起来:

llama.cpp 特性

使用默认编译特性,写个贪食蛇小游戏,约17词元/秒:

默认CPU特性

开启所有CPU特性,写个贪食蛇小游戏,约23词元/秒。提升约 35%

所有CPU特性

顺便对比了一下 Q4 和 Q5 量化 的推理性能区别:

Q4 vs Q5 量化性能

性能区别不大,优先选择Q5,质量更优。

top 预览

看来极致优化还是有一定优势的,特此记录~