
最新更新见:
https://zhuanlan.zhihu.com/p/2031484558114337285
以下为2026-04-25的初步测试。
由于DEEPSEEK官方的DEEPGEMM不支持SM120架构的显卡,包括RTX50系列和RTXPRO6000等最新显卡,所以VLLM和SGLANG首发支持DEEPSEEK-V4支持了一个寂寞。
目前(2026-04-25-20:50)全网我都没有找到一个适配SM120架构显卡的DEEPSEEK-V4的本地部署的信息,甚至其他平台也没有相关的演示与教程。
甚至现在仍然没有任何GGUF格式的模型发布。
所以,大概,是全网第一个在本地部署成功的?

别说笑了,当然不是,第一个肯定是解决了SM120架构部署的第三方作者。
我在这里分享一下相关的部署方法。
信息来源/作者大神提供的方法:
https://github.com/deepseek-ai/DeepGEMM/pull/318
【部署工具-VLLM】
根据指定的DEEPGEMM库和VLLM库编译专用版本的VLLM
git clone https://github.com/jasl/vllm.git
cd vllm
# 添加原作者的远程仓库(如果还没有)
git remote add jasl https://github.com/jasl/vllm.git
# 拉取所有分支
git fetch jasl
# 切换到原型分支(这会覆盖本地修改,请确保没有未保存的工作)
git checkout -b ds4-sm120-prototype jasl/ds4-sm120-prototype
获取 DeepGEMM(SM120 回退支持)
# 克隆作者 jasl 的 sm120 分支
git clone -b sm120 https://github.com/jasl/DeepGEMM.git
git submodule update --init --recursive cd vllm
# 创建虚拟环境(这里用系统默认 python3,建议 python3.10+)
python3 -m venv .venv
# 激活环境
source .venv/bin/activate
# 升级基础工具
pip install --upgrade pip setuptools wheel ninja packaging
#安装torch
pip install torch==2.11.0 torchvision==0.26.0 torchaudio==2.11.0 --index-url https://download.pytorch.org/whl/cu130 所有后续操作(编译、运行)都需要在激活同一个虚拟环境且设置了这些变量的终端中进行。 将它们写成一个脚本或每次手动执行。
# CUDA 工具链路径(根据你实际安装位置调整)
export PATH="/usr/local/cuda/bin:$PATH"
export CUDA_HOME="/usr/local/cuda"
export TRITON_PTXAS_PATH="/usr/local/cuda/bin/ptxas"
# 指定编译架构为 SM120
export CUDA_ARCH_LIST="120a"
export TORCH_CUDA_ARCH_LIST="12.0a"
# 指向我们刚克隆的 DeepGEMM 源码
export DEEPGEMM_SRC_DIR="(你的目录)DeepGEMM"
# (编译阶段暂时不需要下面三个,运行服务时才需要)
# export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
# export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
# export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128 确保虚拟环境已激活,环境变量已设置,然后执行 pip 安装(建议用 --verbose 观察编译过程):
cd vllm
DEEPGEMM_SRC_DIR=$DEEPGEMM_SRC_DIR \
CCACHE_NOHASHDIR=true \
MAX_JOBS=64 \
pip install --verbose --no-build-isolation -e . 注意:有几个坑
1.没有安装相关TOOL的会报错,需要提前安装
2.注意你的TORCH和CUDA的版本,最好是2.10.0+CUDA13.1
3.编译过程中会有占用大量磁盘的临时文件,需要预留几十G的空间。
成功标志:日志中会出现 DeepGEMM CUDA architectures: 12.0a,且无 “Unsupported architecture” 错误。 如果遇到问题,常见情况:
缺少 CUDA 13 的 nvcc → 安装 CUDA toolkit 13 并正确设置 PATH。
DeepGEMM 无法为 SM120 编译 → 确认克隆的是 jasl/DeepGEMM 的 sm120 分支。
模型体积很大,建议放到空间充足的盘。
# 安装 huggingface_hub(如果还没有)
pip install huggingface_hub
# 登录 (需要你的 HuggingFace token,可从 huggingface.co/settings/tokens 获取)
huggingface-cli login
# 下载模型到指定目录
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash \
--local-dir /mnt/AI-Acer4T/AI-Chat/models/DeepSeek-V4-Flash 如果网络慢,可以设置环境变量 export HF_ENDPOINT=https://hf-mirror.com 后再下载。
在同一个终端中(已经激活虚拟环境,并设置了前面的 CUDA 变量),继续:
bash
# 开启 SM120 参考注意力路径(原型开关)
export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128 根据 PR 的测试命令,结合你的模型路径,执行(注意:--max-model-len 262144 内存压力大,若 OOM 可以先改为 32768 或 65536):
以下代码根据你自己的需求,更改为适配你机器的版本。
export VLLM_SM120_REFERENCE_DEEPSEEK_V4_ATTENTION=1
export VLLM_SM120_REFERENCE_TOPK_CHUNK_SIZE=256
export VLLM_SM120_REFERENCE_QUERY_CHUNK_SIZE=128
export VLLM_ATTENTION_BACKEND=FLASH_ATTN_2
export CUDA_DEVICE_ORDER=PCI_BUS_ID
export CUDA_VISIBLE_DEVICES=0,1
vllm serve
/Deepseek/DeepSeek-V4-Flash/
--trust-remote-code
--kv-cache-dtype fp8
--block-size 256
--tensor-parallel-size 2
--tokenizer-mode deepseek_v4
--tool-call-parser deepseek_v4
--enable-auto-tool-choice
--reasoning-parser deepseek_v4
--host 0.0.0.0 --port 8005
--served-model-name VLLM-MODEL
--gpu-memory-utilization 0.95
--max-num-seqs 2
--max-model-len 262144
--compilation-config '{"cudagraph_mode":"FULL_AND_PIECEWISE", "custom_ops":["all"]}'
--async-scheduling
--enable-prefix-caching
--load-format auto
--pipeline-parallel-size 1
--enable-expert-parallel OK,以上就是全部的部署教程。
但是,最后要说一下测试结果。
由于是强行跑通的DEEPGEMM,所以性能极差,RTXPRO6000在LINUX上的速度为:
PREFILL:520 DECODE:35

在AGENT中几乎处于不可用的状态,只能测试和对话使用。
所以建议等待后续官方优化。
或者使用LLAMA.CPP体系的GGUF格式的相关模型,使用诸如LMSTUDIO或者OLLAMA之类的工具进行使用。
感谢观看,觉得有用的朋友请点个赞,或者留言讨论。