由于Deepseek-R1:70B需要约40G的显存,虽然最低可以用16G显存,但如果用单张2080ti22G跑就太慢了,几乎和手写速度差不多,所以直接用两张2080ti22G显卡,均分了算力和显存,达到完美运行的程度,下面就是整个安装过程。
先在到ollama网站下载windows版本的,下载后直接点击安装。

由于安装不能调整参数,只能安装完成后调整安装目录和模型目录。


先到原始安装目录C:\Users\<username>\AppData\Local\Programs\Ollama, 模型目录C:\Users\<username>\.ollama\models全部拷贝到B:\Ollama和B:\Ollama\.ollama\models
然后就是要设置这些环境变量,具体按照图中步骤即可,注意最后一步其实是3步完成的。

然后重新启动windows,启动ollama,然后在命令提示符中用 nvidia-smi 查看显卡情况并用 set CUDA_VISIBLE_DEVICES=0,1 等,设置ollama可以用的显卡。

最后可以用命令ollama run deepseek-r1:70B,就可以自行完成下载和运行。这时可以看到两张显卡内存几乎都跑满,运行速度也能满足要求。

当然,如果需要你可以再配置下网络和防火墙,开启网络功能,用谷歌浏览器安装page assist插件,就可以在局域网上多机使用了。
可以用ollama run deepseek-r1:70B --verbose 命令查看实际速度,
下面是针对同一问题的回答数据
如果采用22G单卡跑32B模型, eval rate: 20.01 tokens/s
如果用单卡22G跑70B模型,eval rate: 0.99 tokens/s
如果采用双卡44G跑70B模型,eval rate: 3.01 tokens/s
双卡开启了SLI,eval rate: 3.70 tokens/s