
近期小蓝收到不少粉丝在后台留言,Intel Arc Pro B系列专业显卡在大型语言模型(LLM)推理场景中的性能表现怎么样呢?今天,蓝戟实验室带来最新的测试数据,以token生成速度为标准,展示蓝戟B70 TF 32GB,B60 TF 24GB和B50 LP 16GB的8卡集群推理性能。

本次测试采用当前热门的开源推理框架vLLM,输入/输出长度均设定为1024tokens。测试覆盖1至512并发(Batch Size)的完整压力区间,三款显卡均以8卡并联配置参与横向对比。
CPU:Intel@ Xeon@ Gold 5416S*2
显卡:GUNNIR Arc Pro B50 / B60 / B70*8
服务器:Supermicro SYS-421GE-TNRT
内存:DDR5 64GB*32
系统版本:Ubuntu24.04.4
在测试中我们发现,70B级别模型的KV Cache占用量巨大,显存容量直接决定了系统能够同时处理的并发请求数量。B70的32GB显存、B60 的24GB与B50的16GB,在这一场景下形成了显著的性能区别。
在DeepSeek-R1-Distill-Llama-70B(FP8 量化)的大模型下,B70 的 32GB 显存使其最优并发点达到 256,而 B60 和 B50 的最优并发点分别在 128 和 64 并发。更值得关注的是,B70 在 512 并发下仍维持 1399 tokens/s,性能衰减仅 1.7%,几乎无损。

如果把模型换为小一些的Qwen3-32B(FP8 量化),B70的最优并发点可以达到最高的512,B60最优并发点达到了256,B50也能提升到128并发最佳。由此可见显存大小在高并发推理中有着决定性的优势。

企业级高并发API服务可选择蓝戟B70 32G系列,70B大模型下,8卡并联可在256~512并发区间做到性能稳定的输出,适合面向C端的大模型服务平台。
中等规模推理集群可选择蓝戟B60 24G系列,70B大模型下,8卡并联仍可支持128并发达到1000+ tokens/s,性价比平衡点,适合中小团队。
边缘推理/轻量服务可选择蓝戟B50 16G系列,32B大模型下,8卡并联也可支持128并发达到1050+ tokens/s,单卡成本最低,适合私有化轻量部署。

从本次测试可以看出显存更大的显卡在高并发推理中有着显著优势。B70的32GB显存不仅支撑了更高的并发上限,更通过vLLM的PagedAttention深度配合,将KV Cache的利用率推向极致,实现了大显存支持高吞吐的线性回报。

对于正在规划大模型推理设备的企业而言,显存规格应成为选择算力GPU的首要考量,而32G大显存的B70有着明显的性能和价格的双重优势,是企业提高算力,降低成本的部署优选。