本地大模型推理速度测试工具
纸鸢随风
编辑于 2025年06月14日 17:38

使用方法

  • 下载HTML文件的zip压缩包并解压

  • 用浏览器直接打开该HTML文件即可使用(无需联网)

注意事项

  • ​​使用OpenAI兼容接口测试时,请确保模型的最大上下文长度设置大于测试中使用的最大提示词长度

  • 在使用Ollama接口进行测试时,若将最大提示词长度参数设置过高,可能导致模型被卸载至内存,从而影响推理速度

  • ​​测试结果可能因API网络延时和计算方法而产生一定误差

  • 连续测试过长时间,可能会因显卡核心温度或显存温度过高而导致推理性能下降

功能特点

  • 完全在浏览器本地运行,无需安装

  • 支持OpenAI兼容接口和Ollama接口

  • 自动生成不同长度的提示词进行测试

  • 可导出Markdown和CSV格式测试结果

运行示例

RTX3090使用SGLang部署QwQ-32B-AWQ模型的测试结果

RTX3090使用Ollama部署devstral:latest模型的测试结果

下载地址

评论区置顶或私信

欢迎大家在评论区分享测试结果