全网第一?DEEPSEEK-V4在SM120架构上本地部署成功!
梦客-独立游戏
编辑于 2026年04月27日 19:03

最新更新见:

https://zhuanlan.zhihu.com/p/2031484558114337285


以下为2026-04-25的初步测试。

由于DEEPSEEK官方的DEEPGEMM不支持SM120架构的显卡,包括RTX50系列和RTXPRO6000等最新显卡,所以VLLM和SGLANG首发支持DEEPSEEK-V4支持了一个寂寞。

目前(2026-04-25-20:50)全网我都没有找到一个适配SM120架构显卡的DEEPSEEK-V4的本地部署的信息,甚至其他平台也没有相关的演示与教程。

甚至现在仍然没有任何GGUF格式的模型发布。

所以,大概,是全网第一个在本地部署成功的?

别说笑了,当然不是,第一个肯定是解决了SM120架构部署的第三方作者。

我在这里分享一下相关的部署方法。

信息来源/作者大神提供的方法:

https://github.com/deepseek-ai/DeepGEMM/pull/318

【部署工具-VLLM】

根据指定的DEEPGEMM库和VLLM库编译专用版本的VLLM

代码块
PlainText
自动换行
复制代码
git clone https://github.com/jasl/vllm.git
cd vllm

# 添加原作者的远程仓库(如果还没有)
git remote add jasl https://github.com/jasl/vllm.git

# 拉取所有分支
git fetch jasl

# 切换到原型分支(这会覆盖本地修改,请确保没有未保存的工作)
git checkout -b ds4-sm120-prototype jasl/ds4-sm120-prototype
复制成功

获取 DeepGEMM(SM120 回退支持)

代码块
PlainText
自动换行
复制代码
# 克隆作者 jasl 的 sm120 分支
git clone -b sm120 https://github.com/jasl/DeepGEMM.git
git submodule update --init --recursive
复制成功

创建 Python 虚拟环境并激活

代码块
PlainText
自动换行
复制代码
cd vllm

# 创建虚拟环境(这里用系统默认 python3,建议 python3.10+)
python3 -m venv .venv

# 激活环境
source .venv/bin/activate

# 升级基础工具
pip install --upgrade pip setuptools wheel ninja packaging

#安装torch
pip install torch==2.11.0 torchvision==0.26.0 torchaudio==2.11.0 --index-url https://download.pytorch.org/whl/cu130
复制成功

设置编译与运行的环境变量

所有后续操作(编译、运行)都需要在激活同一个虚拟环境且设置了这些变量的终端中进行。 将它们写成一个脚本或每次手动执行。

代码块
PlainText
自动换行
复制代码
# CUDA 工具链路径(根据你实际安装位置调整)
export PATH="/usr/local/cuda/bin:$PATH"
export CUDA_HOME="/usr/local/cuda"
export TRITON_PTXAS_PATH="/usr/local/cuda/bin/ptxas"

# 指定编译架构为 SM120
export CUDA_ARCH_LIST="120a"
export TORCH_CUDA_ARCH_LIST="12.0a"

# 指向我们刚克隆的 DeepGEMM 源码
export DEEPGEMM_SRC_DIR="(你的目录)DeepGEMM"

# (编译阶段暂时不需要下面三个,运行服务时才需要)
# export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
# export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
# export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128
复制成功

编译安装 vLLM

确保虚拟环境已激活,环境变量已设置,然后执行 pip 安装(建议用 --verbose 观察编译过程):

代码块
PlainText
自动换行
复制代码
cd vllm

DEEPGEMM_SRC_DIR=$DEEPGEMM_SRC_DIR \
CCACHE_NOHASHDIR=true \
MAX_JOBS=64 \
pip install --verbose --no-build-isolation -e .
复制成功

注意:有几个坑

1.没有安装相关TOOL的会报错,需要提前安装

2.注意你的TORCH和CUDA的版本,最好是2.10.0+CUDA13.1

3.编译过程中会有占用大量磁盘的临时文件,需要预留几十G的空间。

成功标志:日志中会出现 DeepGEMM CUDA architectures: 12.0a,且无 “Unsupported architecture” 错误。 如果遇到问题,常见情况:

  • 缺少 CUDA 13 的 nvcc → 安装 CUDA toolkit 13 并正确设置 PATH。

  • DeepGEMM 无法为 SM120 编译 → 确认克隆的是 jasl/DeepGEMM 的 sm120 分支。


下载 DeepSeek-V4-Flash 模型

模型体积很大,建议放到空间充足的盘。

代码块
PlainText
自动换行
复制代码
# 安装 huggingface_hub(如果还没有)
pip install huggingface_hub

# 登录 (需要你的 HuggingFace token,可从 huggingface.co/settings/tokens 获取)
huggingface-cli login

# 下载模型到指定目录
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash \
  --local-dir /mnt/AI-Acer4T/AI-Chat/models/DeepSeek-V4-Flash
复制成功

如果网络慢,可以设置环境变量 export HF_ENDPOINT=https://hf-mirror.com 后再下载。


启动推理服务

先设置运行时需要的额外环境变量

在同一个终端中(已经激活虚拟环境,并设置了前面的 CUDA 变量),继续:

bash

代码块
PlainText
自动换行
复制代码
# 开启 SM120 参考注意力路径(原型开关)
export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128
复制成功

启动 vLLM 服务

根据 PR 的测试命令,结合你的模型路径,执行(注意:--max-model-len 262144 内存压力大,若 OOM 可以先改为 32768 或 65536):

以下代码根据你自己的需求,更改为适配你机器的版本。

代码块
PlainText
自动换行
复制代码
export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128
export VLLM_ATTENTION_BACKEND=FLASH_ATTN_2
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export CUDA_VISIBLE_DEVICES=0,1
vllm serve
 /Deepseek/DeepSeek-V4-Flash/
 --trust-remote-code
 --kv-cache-dtype fp8
 --block-size 256
 --tensor-parallel-size 2
 --tokenizer-mode deepseek_v4
 --tool-call-parser deepseek_v4
 --enable-auto-tool-choice
 --reasoning-parser deepseek_v4
 --host 0.0.0.0 --port 8005
 --served-model-name VLLM-MODEL
 --gpu-memory-utilization 0.95
 --max-num-seqs 2
 --max-model-len 262144
 --compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}'
 --async-scheduling
 --enable-prefix-caching
 --load-format auto
 --pipeline-parallel-size 1
 --enable-expert-parallel
复制成功

OK,以上就是全部的部署教程。

但是,最后要说一下测试结果。

由于是强行跑通的DEEPGEMM,所以性能极差,RTXPRO6000在LINUX上的速度为:

PREFILL:520 DECODE:35

在AGENT中几乎处于不可用的状态,只能测试和对话使用。

所以建议等待后续官方优化。

或者使用LLAMA.CPP体系的GGUF格式的相关模型,使用诸如LMSTUDIO或者OLLAMA之类的工具进行使用。

感谢观看,觉得有用的朋友请点个赞,或者留言讨论。