8G 显存也能跑 Qwen3.6:手把手本地部署
AI潮汐慢学习
2026年06月01日 17:33
AI创作者

8G 显存也能跑 Qwen3.6:手把手本地部署

消费级 NVIDIA 独显电脑,用 llama.cpp 跑 Qwen3.6-35B-A3B 多模态模型。

这期视频想讲清楚一件事:本地大模型不是必须上服务器。

如果你手里有一台带 NVIDIA 独立显卡的消费级电脑,哪怕显存只有 8GB,也可以尝试跑 Qwen3.6-35B-A3B 这种小型开源模型里很能打的模型。

说人话:这里的 8G 显存不是电脑内存 8GB,而是显卡自己的显存。很多游戏本、设计本、台式机里的 RTX 3060、RTX 3070、RTX 4060,常见就是这个级别。普通核显办公本不在这篇教程范围内。

它不是要替代所有云端旗舰模型。它真正有价值的地方,是把资料整理、图片理解、代码辅助、文档问答这些任务,先放在本机或内网里完成。

为什么这个模型值得试

Qwen3.6-35B-A3B 的名字里有两个关键点:35B 和 A3B

35B 表示总参数规模,A3B 表示每次推理大约激活 3B 参数。说人话就是:它看起来是一个 35B 级别的模型,但每一步推理并不是把全部参数都点亮。

这种 MoE 架构给了它一个很现实的优势:在合适的量化版本和运行参数下,小显存机器也可以尝试跑起来。

在 Artificial Analysis 的公开榜单里,Qwen3.6-35B-A3B reasoning 版本的 Intelligence Index 是 43。这个数字不是人类 IQ,也不是唯一标准,但可以作为参考:在本地可部署的小型开源模型里,它确实是很靠前的一档。

它适合做什么

1. 本地对话和资料问答。

2. 写文档、整理提纲、总结会议纪要。

3. 识别图片,配合文档做多模态理解。

4. 生成代码、改小项目、做页面原型。

5. 给个人、小团队和企业内部流程做低成本试错。

如果你的资料涉及合同、产品文档、代码仓库、内部知识库,本地模型的意义就更明显。不是所有东西都要第一时间丢到云端。

普通电脑到底要准备什么

这篇教程默认你是 Windows + NVIDIA 独显环境。

建议配置:NVIDIA 独立显卡、8GB 以上显存、32GB 以上内存、40GB 以上空闲硬盘空间。视频里演示的是 8GB 显存能跑通,但如果你要长上下文、多模态、同时开很多程序,64GB 内存会更舒服。

有一点要说清楚:8GB 显存能跑,不等于所有 8GB 电脑体验都一样。CPU、内存、硬盘、显卡代际、CUDA 版本、上下文长度,都会影响速度。

下载 llama.cpp 和 CUDA

先下载 llama.cpp 的 Windows 版本:

https://github.com/ggml-org/llama.cpp/releases

NVIDIA 显卡主要看 CUDA 版本。视频里的选择方式是:

RTX 20 系列及更早:选择 Windows x64 (CUDA 12)

RTX 30/40/50 系列:选择 Windows x64 (CUDA 13)

如果 release 页面版本号更新,以页面当前显示为准。比如现在页面会把 Windows x64 (CUDA 12) 和 Windows x64 (CUDA 13) 分开列出来。

CUDA 下载地址:

CUDA 12.4:developer.nvidia.com/cuda-12-4-0-download-archive

CUDA 13.1:developer.nvidia.com/cuda-13-1-0-download-archive

如果你已经装过 CUDA,也不要急着重复安装。先确认 llama.cpp 下载的 CUDA 版本和你机器上的驱动、CUDA 环境能对上。

下载主模型和视觉模型

主模型:unsloth/Qwen3.6-35B-A3B-MTP-GGUF,选择 UD-Q4_K_M,大小大约 22.7GB。

视觉模型:unsloth/Qwen3.6-35B-A3B-GGUF,选择 mmproj-BF16.gguf,大小大约 903MB。

主模型负责文字和推理,mmproj 负责把图片接进来。你要做图片识别、多模态理解,就要把它也放进去。

顺便补一个量化常识:模型的“满血版本”一般可以理解成 16 位,也就是 FP16 / BF16 这一类精度,效果最完整,但文件体积、显存和内存要求也最高。量化到 8 位,通常对效果影响很小,但资源占用已经能降不少。

继续往下,6 位、5 位、4 位就是在能力、速度和资源占用之间做取舍。Q4,尤其是 Q4_K_M 这类量化,常被当成本地部署的甜点位:模型能力会有下降,但一般还在可接受范围内,换来的好处是显存和内存压力明显降低。

如果再低到 3 位、2 位这一类,体积会更小,但模型的智力、推理能力和输出稳定性就更容易出现明显下降。不同模型、不同量化方法会有差异,所以这是一条经验判断,不是绝对规则。

文件怎么放

解压 llama.cpp 压缩包后,在目录里创建一个 models 文件夹。

然后把两个文件放进去:

代码块
PlainText
自动换行
复制代码
Qwen3.6-35B-A3B-UD-Q4_K_M-MTP.gguf mmproj-BF16.gguf
复制成功

视频里示例路径是:

代码块
PlainText
自动换行
复制代码
E:\llama\llama-b9196-bin-win-cuda-12.4-x64\models
复制成功

你的目录不一定一样。重点是 BAT 脚本里的路径和真实文件名必须完全一致。

直接复制这个 BAT 启动脚本

把下面内容保存成一个 .bat 文件,比如 start_qwen36.bat,放在你方便找到的位置。

代码块
PlainText
自动换行
复制代码
@echo off
chcp 65001 >nul
cd /d E:\llama\llama-b9196-bin-win-cuda-12.4-x64

llama-server.exe ^
  -m "models\Qwen3.6-35B-A3B-UD-Q4_K_M-MTP.gguf" ^
  --mmproj "models\mmproj-BF16.gguf" ^
  -ngl 99 ^
  --n-cpu-moe 999 ^
  --flash-attn on ^
  --jinja ^
  --spec-type draft-mtp ^
  --spec-draft-n-max 2 ^
  -c 65536 ^
  -t 12 ^
  -b 512 ^
  -ub 128 ^
  --cache-type-k q4_0 ^
  --cache-type-v q4_0 ^
  --mlock ^
  --host 0.0.0.0 ^
  --port 8080

pause
复制成功

你通常只需要改两处:

第一处是 cd /d 后面的 llama.cpp 解压目录。

第二处是 -m 后面的主模型文件名。文件名只要多一个空格、少一个字符,都可能启动失败。

看懂几个关键参数就够了

--mmproj:开启图片理解能力。如果你只做纯文本,可以先不加,少占一点资源。

-ngl 99:尽量把能放到 GPU 的层放进显卡里跑。显存不足时可以往下调。

--n-cpu-moe 999:把 MoE 专家层放到 CPU 内存里,这是小显存跑 35B-A3B 的关键配置之一。代价是速度会更依赖 CPU 和内存。

--flash-attn on:开启 Flash Attention,长上下文时更有意义。

--jinja:按模型的聊天模板组织消息,一般建议开。

--spec-type draft-mtp 和 --spec-draft-n-max 2:启用 MTP 推测解码,主要是为了提升生成速度,不是提升模型智商。

-c 65536:64K 上下文。能放更长文档,但也更吃内存和显存。

--host 0.0.0.0:允许局域网设备访问。只在本机用,可以改成 --host 127.0.0.1。

启动成功后,本机访问:

代码块
PlainText
自动换行
复制代码
http://127.0.0.1:8080
复制成功

如果接 Open WebUI、Hermes Agent 或其它支持 OpenAI 兼容接口的工具,一般 base URL 可以填:

代码块
PlainText
自动换行
复制代码
http://127.0.0.1:8080/v1
复制成功

如果启动不稳,先这样降一点

8GB 显存第一次跑,不要一上来就把所有参数拉满。能跑通比漂亮参数更重要。

可以先把这几项降下来:

代码块
PlainText
自动换行
复制代码
-c 32768 ^ -b 256 ^ -ub 64 ^ --host 127.0.0.1
复制成功

这相当于先把上下文和批处理规模降一点,让机器压力小一点。跑通以后,再一点点往上加。

最常见的问题就三个:

路径写错。模型文件名必须和脚本完全一致。

CUDA 不匹配。下载的 llama.cpp CUDA 版本、系统驱动、CUDA 环境要对上。

内存不够。64K 上下文、多模态和大模型一起开,内存压力会明显上来。

最后还有一个建议:8GB 显存是“能跑通”的门槛。如果你希望体验更流畅、更顺利,尽量放到 24GB 显存的 GPU 上跑。

到了 24GB 显存这个级别,上下文也可以更大胆一点。比如把 -c 65536 改成 -c 262144,也就是 256K 上下文。长文档、长对话、代码仓库理解会更舒服,但内存、KV cache 和生成速度也会一起吃紧。

延伸:想看懂 BAT 脚本的人看这里

前面那部分已经足够照着跑。下面这段是给想继续往里看的人:每一行脚本到底在做什么,以及哪些参数最影响速度、显存和稳定性。

脚本逐行说明

@echo off:关闭命令回显,窗口不会把每条执行命令重复打印一遍。

chcp 65001 >nul:切换到 UTF-8 编码,减少中文乱码;>nul 用来隐藏这条命令的输出。

cd /d E:\llama\llama-b9196-bin-win-cuda-12.4-x64:进入 llama.cpp 程序目录;/d 允许从其它盘符切到 E 盘。

llama-server.exe ^:启动 llama.cpp 服务端;行尾 ^ 是 Windows BAT 的续行符,表示下一行继续属于同一条命令。

-m "models\Qwen3.6-35B-A3B-UD-Q4_K_M-MTP.gguf" ^:指定主模型文件。这里使用 Qwen3.6-35B-A3B 的 GGUF 量化模型,文件名带 MTP。

--mmproj "models\mmproj-BF16.gguf" ^:指定多模态视觉投影模型。需要图片理解时使用;纯文本对话可以不加。

-ngl 99 ^:设置 GPU offload 层数,让可放入显存的层进入 GPU 加速。

--n-cpu-moe 999 ^:让 MoE 专家层放在 CPU 内存里。对小显存运行大 MoE 模型比较关键,速度会受 CPU 和内存影响。

--flash-attn on ^:开启 Flash Attention,降低 Attention 计算的显存压力,并改善长上下文计算效率。

--jinja ^:启用模型自带的 Jinja 聊天模板,让角色消息格式更符合模型要求。

--spec-type draft-mtp ^:启用 MTP 推测解码,使用模型里的 MTP 草稿头提前预测后续 token。

--spec-draft-n-max 2 ^:设置 MTP 草拟 token 上限为 2。数值过高不一定提升速度,2 是偏保守的配置。

-c 65536 ^:上下文窗口设置为 65536 token,也就是 64K。历史对话、文档和输出都会占用上下文。

-t 12 ^:CPU 推理线程数设置为 12。MoE 专家放在 CPU 时,这个参数会影响生成速度。

-b 512 ^:batch size,影响 prompt 和上下文读入阶段。数值高一些通常更快,但会增加内存和显存压力。

-ub 128 ^:micro-batch size,把 batch 拆成更小的块执行。数值低一些会降低显存压力,但速度可能下降。

--cache-type-k q4_0 ^:KV cache 里的 Key 使用 q4_0 量化,减少长上下文缓存占用。

--cache-type-v q4_0 ^:KV cache 里的 Value 使用 q4_0 量化。它和主模型的 Q4_K_M 量化不是同一个概念。

--mlock ^:尝试把模型锁在内存里,减少被系统换到硬盘虚拟内存的情况。内存不足时可能启动失败或带来系统压力。

--host 0.0.0.0 ^:监听所有网卡,局域网其它设备也可能访问服务。单机自用可以改成 --host 127.0.0.1。

--port 8080:服务端口为 8080。本机访问地址是 http://127.0.0.1:8080。

pause:命令执行结束后暂停窗口。启动失败时,窗口不会直接关闭,方便查看错误信息。

关键参数作用

--mmproj:开启图片理解能力。纯文本任务可以关闭,减少额外资源占用。

-ngl 99:把可 offload 的层放到 GPU,提高推理速度;显存不足时需要调低。

--n-cpu-moe 999:把 MoE 专家放到 CPU,是小显存运行 35B-A3B 的核心配置之一。

--flash-attn on:降低 Attention 计算资源占用,长上下文场景价值更明显。

--jinja:按模型模板组织聊天消息,通常建议开启。

--spec-type draft-mtp 与 --spec-draft-n-max 2:启用 MTP 推测解码,主要提升生成阶段速度,不会提升模型能力。

-c 65536:开启 64K 上下文,适合长文档,但会增加 KV cache、内存和显存压力。

-b 512 与 -ub 128:控制读入上下文时的批处理规模。数值越大,速度和资源占用通常同步上升。

--cache-type-k q4_0 与 --cache-type-v q4_0:压缩 KV cache,降低长上下文占用,代价是可能带来一定精度损失。

--mlock:减少模型被换出到硬盘虚拟内存的概率,适合内存充足的环境。

--host 0.0.0.0:允许局域网访问。只在本机使用时,改成 --host 127.0.0.1 更合适。

最后说一句实际感受

Qwen3.6-35B-A3B 不是拿来替代所有云端大模型的。

它更像一个本地可控的工作底座:写文档、看图片、读资料、改代码、做原型,先在本机跑起来,再决定哪些任务需要上云。

这对个人、小团队和有数据边界要求的企业内部流程,都很有意义。

如果这篇文章对你有启发或帮助,欢迎点个赞或收藏,方便之后随时回看。

资料链接

llama.cpp releases:github.com/ggml-org/llama.cpp/releases

CUDA 12.4:developer.nvidia.com/cuda-12-4-0-download-archive

CUDA 13.1:developer.nvidia.com/cuda-13-1-0-download-archive

主模型:huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF

视觉模型:huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF/tree/main

Artificial Analysis:artificialanalysis.ai/models/qwen3-6-35b-a3b