8G 显存怎么跑本地大模型?
16G 显存的取舍我写过一篇,这回把档次再往下压:手里只有一张 8G 的卡——RTX 3070、4060、2060 Super,或者 4070 Laptop 这种 8G 笔记本——还能不能跑本地大模型?技术上能跑,甚至能跑 35B;但"能跑"和"好用"之间隔还是有点远啊。本文全部数据来自真实实测,出处见文末。
一、先摆结论:8G 能跑 35B,但别高兴太早
先说反直觉的部分:8G 显存跑 35B 大模型,是可行的。论坛里至少四张不同的 8G 卡(3070、4060、2060 Super、4070 Laptop)都成功跑起了 Qwen3.6-35B-A3B,速度从 17 t/s 到 42 t/s 不等,甚至有人把 35B 塞进了 8G 笔记本还开出 128K 上下文[1][2][3][4]。
但同一批帖子里,楼主自己的评价是这样的:
- "编码可以跑。能处理图片。其他的拉稀中。总结:学习机小拉拉一枚。"[1]
- "这个小拉拉实际应用没有任何意义。或者直白点就是 8G 就是没什么意义。我的任意项目它都是跑不了的。"[1]
- "8G 的卡只能是跑起来而已,用来驱动 agent 几乎不可用的。"[3]
为什么会有这种分裂? 因为 8G 的瓶颈从来不是"装不装得下模型",而是预填充(prefill)速度。日常聊天、短代码问答,体验尚可;一旦接上 Agent(比如 Hermes),系统提示词动辄 20K+ token,8G 卡的 prefill 就会慢到让人失去耐心[3]。
所以本文的正确读法是:8G 能带你入门、能跑通、能理解参数,但它不是生产力工具的上限,而是一个"折腾甜点"。
二、核心原理:MoE + CPU Offload 是 8G 的救命稻草
8G 能跑 35B,靠的不是什么黑科技,而是架构红利:
Qwen3.6-35B-A3B 是混合专家模型(MoE):35B 总参数,但每次推理只激活约 3B 参数[1]。这意味着 GPU 不需要一次性加载完整的 35B 权重。
再叠加 llama.cpp 的两个能力:
- CPU Offload(
-ngl):控制多少层放 GPU,其余放内存; - MoE 专家路由(
--n-cpu-moe):把非激活的专家层丢到系统内存,GPU 只保留注意力层和少量专家[2]。
于是形成"GPU 跑注意力层、内存跑专家层"的分工——这才是 8G 卡能跑 35B 的核心原因[1]。代价是:速度上限被内存带宽锁死,因为每生成一个 token 都要从内存里搬专家权重。
反过来说:如果你用的是同尺寸的稠密(Dense)模型,比如 27B 稠密,那 8G 基本没戏——Q4 量化后权重就要 15GB 以上,根本放不下,硬 offload 会慢到不可用[5]。
三、模型怎么选:35B-A3B MoE,还是退一步用 9B
8G 上有两条路线,选哪条取决于你要干什么。
路线一:35B-A3B MoE——"能跑大模型"的执念
这是论坛里 8G 玩家最热衷的方向,因为"8G 跑 35B"本身就有巨大的心理满足感。实测也确实能跑:
- RTX 3070 8G + i7-12700,Q4_K_M 量化,
-ngl 99 --n-cpu-moe 999,32K 上下文,还支持多模态和网页 UI[1] - RTX 4060 8G + R7 5700X,APEX-MTP 量化(13.7GB),
-ngl 999 --n-cpu-moe 32,64K 上下文,短输出 30+ t/s、代码场景 45-50 t/s[3] - RTX 4070 Laptop 8G,Q4_K_M,短文本 42.3 t/s、Thinking 模式 42.1 t/s,一键包支持 128K + 多模态[4]
路线二:9B 级稠密模型——"真的好用"的务实选择
论坛里不止一个人劝退"8G 硬上 35B":
"4060 还是玩 9B 吧……跑起来还快点。"[3]
在工具调用(function calling)这个对 8G 最关键的场景里,有会员给出了明确建议[5]:
8G(4070):27B 的 Q4 要 15G 以上,放不下。8G 实际能打的是 Qwen3-8B、GLM-4-9B(同尺寸里工具调用很强)、Gemma3-12B Q4 勉强压线。别为了"跑大模型"硬上 27B 的低量化档——如果只是翻译或者写文本倒是无所谓了,但工具调用对量化损伤很敏感,降档后 function call 格式会先崩。
这句话很关键:Agent 场景下,"小模型满精度"往往打得过"大模型低量化"。因为工具调用要求模型稳定输出 JSON schema,低量化会先破坏这种结构化输出能力。
四、量化怎么选:8G 的量化比 16G 更极端
8G 上量化档位的选择空间比 16G 窄得多,但方向是一致的——找到能全层上卡、又不至于把质量整崩溃的那一档。
论坛实测过的几档(35B-A3B):
| 量化 | 大小 | 8G 卡适配情况 | 出处 |
|---|---|---|---|
| Q4_K_M | 16.5 GB | 权重就超 8G,必须重度 offload,能跑但吃力 | [1][4] |
| APEX-MTP-I-Mini | 13.7 GB | 4060 上 30+ t/s、代码 45-50 t/s,8G 的"毕业配置" | [3] |
| APEX-I-Quality | ~16.8 GB | 异构多卡(12G+8G)上 prefill 1279 t/s、decode 88.8 t/s | [6] |
| IQ2_M | 最小 | 2060 Super 上唯一能稳定跑 8K 上下文的档位,~17 t/s | [2] |
| Q3_K_XL | ~16.8 GB | 需要 24G 以上才舒服,8G 上偏重 | [3] |
几个结论:
- 8G 上"精度换速度"是刚需。16G 上还能讲究 IQ4_XS 全层上卡,8G 上往往要一路降到 APEX/IQ2 级别,甚至接受"模型智商明显下降"[2]。
- APEX 量化是 8G 的惊喜。它把 35B 压到 13.7GB,配合 MTP(多 token 预测)能在 4060 上跑出 30+ t/s,被社区称为"8G 显存的毕业配置"[3]。
- 别迷信低量化能救一切。IQ2_M 虽然塞得下,但作者自己也说"完全没有意思""硬件限制上不到 16K"[2]——量化降到这个程度,模型能力已经受损。
五、关键参数:--n-cpu-moe 和 -fit off
8G 跑大 MoE 模型,参数比模型更重要。论坛里一份"极限参数定稿报告"把调参过程完整记录了下来,非常有参考价值[2]:
阶段 1:默认参数(失败)
-ngl 80 -c 4096
现象:显存逼近 8G 爆满,报 failed to fit params to free device memory,llama.cpp 自动回退,速度断崖式跌到 ~7.5 t/s。
阶段 2:开启 MoE 专家路由(部分改善)
-ngl 80 --n-cpu-moe 38 -c 4096
显存降到 ~2.5G(异常偏低),速度 ~15 t/s。问题:GPU 层数被削太狠,大量权重滞留内存,瓶颈变成内存带宽。
阶段 3:强制显存适配 + 降 GPU 层数(关键突破)
-ngl 30 --n-cpu-moe 20 -c 4096 -fit off
显存 6.8G / 8G(余量 1.3G),速度 ~15 t/s。-fit off 关闭自动适配后,30 层权重成功驻留显存,进入甜点区。
阶段 4:上下文扩容(最终定稿)
-ngl 30 --n-cpu-moe 20 -c 8192 -fit off
显存 7.0G / 8G(余量 1.1G),速度 ~17 t/s。上下文翻倍,显存只多 200MB,速度反而微升。
这份报告的核心经验[2]:
--n-cpu-moe是 8G 卡跑大 MoE 的核心参数,负责把非激活专家路由到内存;不能无脑-ngl 80,要配合-fit off手动控制显存分配。- 显存甜点区是 6.5G ~ 7.2G:低于 6G,GPU 层数不足、速度受限;高于 7.5G,余量不够,Windows 的 WDDM 驱动一波动就爆显存、速度断崖。
- Windows 的可用显存要比标称少:标称 8192 MiB,实际空闲只有 7158 MiB;同配置在 Linux 下预计能多出 500MB~1G,有望稳定 16K 上下文[2]。
- 上下文和速度不总是负相关:4K→8K 速度从 15 微升到 17 t/s,因为 4K 时 GPU 利用率没吃满,8K 反而让流水线更饱和[2]。
- Thinking 会偷偷吃掉 token:复杂 prompt 容易陷入长推理,建议前端加约束"请直接回答,不要输出思考过程"[2]。
另外,KV 缓存量化也是 8G 的必备技巧:--cache-type-k q4_0 --cache-type-v q4_0 能大幅省显存换上下文[1];如果显存还有余量,用 q8_0 质量更稳[3]。
六、实测数据的真实表现
把论坛里几张 8G 卡的实测数据放在一起看,差异非常明显:
| 显卡 | CPU/内存 | 模型/量化 | 上下文 | 生成速度 | 备注 |
|---|---|---|---|---|---|
| RTX 3070 8G | i7-12700 / 64G | 35B-A3B Q4_K_M | 32K | 编码可跑 | 多模态+UI,作者自称"学习机"[1] |
| RTX 2060 Super 8G | i7-4790K / 32G DDR3 | 35B-A3B IQ2_M | 8K | ~17 t/s | 极限定稿,甜点区 6.5-7.2G[2] |
| RTX 4060 8G(台式) | R7 5700X / 64G | 35B-A3B APEX-MTP | 64K | 30+ t/s,代码 45-50 | prefill ~499 t/s[3] |
| RTX 4060 8G(USB4 笔记本) | R7 6850HS / 32G | 35B-A3B APEX-MTP | 64K | 同上但 prefill 慢 3 倍 | prefill ~168 t/s[3] |
| RTX 4070 Laptop 8G | i7-14650HX / 32G | 35B-A3B Q4_K_M | 128K | 42.3 t/s | 一键包,多模态+Agent[4] |
| 4070 8G 笔记本 | — | 35B-A3B | — | 35 t/s | 成功接入 Hermes[1] |
几个观察:
- 同是 4060 8G,台式机和 USB4 外接笔记本差 3 倍——差的不是 GPU 算力,而是 PCIe vs USB4 的带宽/延迟,以及移动 CPU 的持续功耗和内存带宽[3]。
- CPU 和内存同样重要:2060 Super 配 DDR3 只能跑 17 t/s,而 4060 配 DDR4-3200 能跑 30+;专家层跑在内存里,内存带宽直接决定下限[2][3]。
- 异构多卡是一条野路子:有人用双 2060 12G + 2070 8G 组异构,跑 35B APEX 量化,prefill 达到 1279 t/s、decode 88.8 t/s[6]——但这已经超出"单张 8G"的范畴了。
七、连接方式之争:USB4/雷电 vs OCuLink
先回答一个很多人搞混的问题:USB4 和雷电(Thunderbolt)到底是不是一回事?
答案是"同源但不等同"。Intel 当年把 Thunderbolt 3 的协议贡献给了 USB-IF,这套协议后来就成了 USB4(2019 年发布)。所以:
- 雷电 3 / USB4 40Gbps / 雷电 4:底层是同一套协议,eGPU 走的都是 PCIe 3.0 x4 隧道(约 32 Gbps 可用、约 3.9 GB/s);
- 雷电 4 只是 USB4 40Gbps 之上的更严格认证(强制 40Gbps、PCIe 隧道 ≥32Gbps);
- 雷电 5 / USB4 v2 才把带宽拉到 80/120 Gbps(PCIe 4.0 x4 隧道)。
关键结论:所谓"USB4 不行",问题不在"USB4 比雷电差"——USB4 40Gbps 和雷电 3/4 的 eGPU 带宽本质是一样的。真正的瓶颈是这套隧道机制本身的开销和延迟,跟原生 PCIe 有先天差距[3]。换句话说,你换成雷电 3/4 的显卡坞,也不会比 USB4 好到哪去。
那什么更好?OCuLink。
OCuLink(SFF-8611)走的是原生 PCIe 信号,不经 USB/雷电的协议封装(隧道),所以延迟更低;规格上常见 PCIe 3.0 x4(32 Gbps)或 PCIe 4.0 x4(64 Gbps)——后者是 USB4/雷电 3/4 的两倍带宽。代价是不支持热插拔、线缆不供电(要独立电源)、线短、还要占一个 M.2/PCIe 槽。
论坛里有一份同一张 7900 XTX 在不同连接方式下的实测阶梯,非常有说服力[7]:
| 连接方式 | 预期生成速度(tg mean) |
|---|---|
| 雷电 3 eGPU(Razer Core X Chroma) | 37–45 t/s |
| OCuLink 改装同一个坞(~$80,3 小时) | 52–55 t/s |
| 移到 X99 台式机(PCIe 3.0 x16) | 58–62 t/s |
| 现代 AM5 + PCIe 4.0 x16 | 67 t/s |
OCuLink 比雷电 3 快了约 40%(37-45 → 52-55),几乎追平原生 PCIe 3.0 x16。所以对 eGPU 跑 LLM,OCuLink 是比雷电/USB4 更划算的选择。另有会员在 OCuLink + R9700 上实测 Q4 量化:pp512 达 680 t/s、tg128 约 29.5 t/s、开 MTP 长输出约 43 t/s,作者表示没观察到明显的链路瓶颈[8](不过他强调没有同卡 PCIe x16 的 A/B 对照,结论只能作参考)。
回到 8G 笔记本的场景,连接方式的影响同样明显[3]:
- 台式机 PCIe 内置 RTX 4060:长 prompt processing ≈ 499 tok/s
- 笔记本 USB4 外接 RTX 4060:长 prompt processing ≈ 168 tok/s(慢近 3 倍)
原因有四[3]: 1. USB4 eGPU 的带宽和延迟弱于台式机 PCIe; 2. 35B-A3B 依赖 CPU MoE,CPU/GPU 协作频繁,链路瓶颈被放大; 3. 移动端 CPU 的持续功耗、散热、内存带宽不如台式机; 4. 笔记本内存通常 32G,64K 上下文 + prompt cache + CPU MoE 时余量更小。
(补充一个兼容性坑:有会员反馈 Blackwell + USB4 + Linux CUDA 运算必崩,RTX 5090 eGPU 在 Linux 下无法启动[9]——外接显卡不光看带宽,还要看平台兼容性。)
笔记本的务实建议[3]:
- 上下文降到 32K(ctx-size = 32768),n-cpu-moe 提到 35;
- 或者干脆改用能完整放进 8G 的小模型(Qwen3.5-9B、7B/8B coder),避开 CPU MoE 的链路瓶颈;
- 别把笔记本当主力 Agent 服务端;
- 真要外接,优先考虑 OCuLink 而非雷电/USB4 显卡坞。
八、笔记本 4060 能逼近笔记本 4070?
回头看第六节的表,有个现象值得单独拆开:笔记本 RTX 4060(低一档的卡)居然和笔记本 RTX 4070(高一档的卡)打得不分上下——笔记本 4060 短输出 30+ t/s、代码 45-50 t/s[3],笔记本 4070 是短文本 42.3 t/s、Thinking 42.1 t/s[4]。按理说 4070 该碾压 4060,为什么会这样?
最重要的:笔记本 4060 和 4070 的显存带宽完全相同。
| 显卡 | 核心 | CUDA 核 | 位宽 | 显存带宽 |
|---|---|---|---|---|
| RTX 4060 Laptop | AD107 | 3072 | 128-bit | 256 GB/s |
| RTX 4070 Laptop | AD106 | 4608 | 128-bit | 256 GB/s |
| (对比)RTX 4060 桌面 | AD107 | 3072 | 128-bit | 272 GB/s |
| (对比)RTX 4070 桌面 | AD104 | 5888 | 192-bit | 504 GB/s |
笔记本 4060 和 4070 都是 128-bit、16 Gbps 的 GDDR6,带宽都是 256 GB/s——4070 多出来的 1536 个 CUDA 核,并没有换来带宽提升。而 LLM 解码(decode)是"带宽瓶颈"型任务:每生成一个 token,都要把权重从显存完整读一遍,速度基本由显存带宽决定,而不是 CUDA 核数。带宽一样,解码速度自然就接近。
然后,频率差异又补了一刀——笔记本 4060 的加速频率反而更高。 这是很多人忽略的变量:AD107 核心数少、功耗密度低,反而能跑到更高的频率。官方规格里,RTX 4060 Laptop 的 Boost 频率约 2370 MHz,比 RTX 4070 Laptop 的约 2175 MHz 还高(部分高 TGP 机型 4060 能上到 2460 MHz,而 4070 大约封顶 2295 MHz)。用"核心数 × 频率"估有效算力:
| 显卡 | 核心数 | Boost 频率 | 有效算力(核·MHz) |
|---|---|---|---|
| RTX 4060 Laptop | 3072 | ~2370 MHz | 7.28 M |
| RTX 4070 Laptop | 4608 | ~2175 MHz | 10.02 M |
4060 的有效算力达到了 4070 的约 73%,而不是纯核数比给出的 67%——频率优势把差距从 33% 缩小到了约 27%。再考虑笔记本里持续负载下的实际频率(小核心更容易维持高频),差距还会进一步收窄。所以"核心数"这一项的影响力,被频率抵消了相当一部分;在带宽瓶颈的 decode 阶段,频率和核数都不太起作用,两者更是难分高下。
少得可怜的那点差距,用处也不大,因为多出来的核数只在 prefill 阶段有优势。 prefill(处理输入 prompt)是计算密集操作,有效算力(核心数 × 频率)更高的 4070 会快一些;但到了逐 token 输出的 decode 阶段,两者又被带宽拉回同一水平。所以"聊天的体感速度"(看 decode)差不多,只有"首字延迟"(看 prefill)4070 占优。
而且,两者都是笔记本芯片,功耗墙和散热限制相同。 4060 Laptop 和 4070 Laptop 的可配置功耗区间都是 35–115W,薄本里常年 60–80W 且会热降频。LLM 推理是持续负载,谁都没法长时间跑满,差距进一步被抹平。
最后,配置差异也在放大或缩小差距。 笔记本 4060 那组用了 APEX-MTP(带 MTP 投机解码,提速 30-50%),笔记本 4070 那组是 Q4_K_M、没提 MTP[3][4]。所以"4060 看起来不输 4070"里,有一部分是量化/MTP 配置的功劳,不全是硬件的。
反过来看桌面版就明白了:桌面 4060(272 GB/s)和桌面 4070(504 GB/s)带宽差了近一倍,档次差距立刻显现——桌面 4070 在解码上能明显碾压桌面 4060。笔记本 4060/4070 之所以"打平",本质是"同带宽、不同核数、但频率反超"三者叠加;桌面 4060/4070 则是"带宽差一倍",差距自然拉开。
一句话总结:选卡跑本地模型,先看显存带宽,再看有效算力(核心数 × 频率)。 笔记本 4060 和 4070 共享 256 GB/s 带宽,且 4060 频率更高、部分抵消核数劣势,所以在带宽瓶颈的 LLM 解码里难分高下。
九、8G 到底能干什么:Agent 场景的现实
这一节可能是新手朋友最关心的了。
能干的: - 日常对话、短代码补全、文本翻译; - 图片/视频问答(多模态,8G 也支持)[1][4]; - 轻量 Agent 任务(有会员在 4070 8G 笔记本上接 Hermes 成功执行多种任务)[1]; - 学习理解 MoE、offload、量化这些概念——8G 是最好的"教具"[2]。
干不动的: - Hermes 这类 Agent 的默认系统提示词就有 20K+ token。8G 卡 prefill 速度约 300 tok/s,光处理提示词就要等很久,实际使用"基本没什么效率可言"[3]; - 复杂多轮工具调用——量化降档后 function call 格式先崩[5]; - 长代码生成——输出长了会明显变慢,最好让 Agent 分文件、分阶段输出[3]。
一位带佬的总结很到位[3]:
8G 的卡只能是跑起来而已,用来驱动 agent 几乎不可用的。
所以对 8G 玩家,我的建议是把心态放对: - 想"跑通、学原理、发帖炫技"→ 35B-A3B MoE,尽情折腾; - 想"日常真的用起来"→ 老老实实用 9B 稠密 + 满精度,或者升级到 16G/24G; - 想"驱动 Agent 干正事"→ 8G 不够,这不是调参能解决的,是硬件天花板。
十、给 8G 玩家的一张速查表
| 你的诉求 | 推荐模型 | 量化 | 关键参数 |
|---|---|---|---|
| 就想跑通 35B 玩玩 | Qwen3.6-35B-A3B | APEX-MTP-I-Mini (13.7G) | -ngl 999 --n-cpu-moe 32,KV q8_0 |
| 极限压榨(2060S 级) | 35B-A3B | IQ2_M | -ngl 30 --n-cpu-moe 20 -c 8192 -fit off |
| 日常对话/短代码 | Qwen3.5-9B / 8B coder | Q8_0 | 全层上卡,别 offload |
| 工具调用/Agent | Qwen3-8B / GLM-4-9B | 高精度 | 别用 27B 低量化 |
| 多模态 | 35B-A3B + mmproj | Q4_K_M | --mmproj 加视觉文件 |
| 笔记本 | 9B 稠密 | 高精度 | ctx-size 32768,n-cpu-moe 35 |
三条铁律:
1. 8G 跑大模型,--n-cpu-moe 和 -fit off 比模型本身更重要,显存控制在 6.5-7.2G 的甜点区;
2. 能跑 ≠ 好用,Agent 场景的瓶颈是 prefill,不是生成速度;
3. 别为了"跑大模型"硬上低量化,尤其工具调用场景,小模型满精度往往更实用。
8G 不是废物,它会让你清楚地看到显存、带宽、量化三者之间的取舍。折腾它,你能学会所有该学的;指望它,你会失望。理性折腾,量力而行。
参考来源
本文全部实测数据来自抡锤者(lcz.me)论坛会员的真实分享,原帖均可点击核对完整配置与测法:
- 8G显存 篇。RTX3070 8G显存。成功跑 Qwen3.6-35B 多模态AI大模型 — https://lcz.me/topic/262/262/8g显存-篇-rtx3070-8g显存-成功跑-qwen3.6-35b-多模态ai大模型(TID:262)
- RTX 2060 Super 8G 部署 Qwen3.6-35B-A3B 极限参数定稿报告 — https://lcz.me/topic/342/342/rtx-2060-super-8g-部署-qwen3.6-35b-a3b-极限参数定稿报告(TID:342,极限调参四阶段)
- 【RTX4060】【8G显存】运行Qwen3.6 35B A3B APEX-MTP包含两种方式及测试结果 — https://lcz.me/topic/213/213/rtx4060-8g显存-运行qwen3.6-35b-a3b-apex-mtp包含两种方式及测试结果(TID:213,台式机 vs USB4 笔记本、n-cpu-moe 调优)
- 开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent — https://lcz.me/topic/1080/1080/开源个安装包qwen3.6-35b-塞进了-8gb-显存笔记本-128k-多模态-thinking-一键安装还能接本地-agent(TID:1080)
- 【请教】对于7900xtx-24G和4070-8G这类小显存显卡,进行工具调用的模型有什么评分之类的信息出处供参考么? — https://lcz.me/topic/1066/1066/请教-对于7900xtx-24g和4070-8g这类小显存显卡-进行工具调用的模型有什么评分之类的信息出处供参考么(TID:1066,8G 工具调用模型建议)
- 雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality — https://lcz.me/topic/1092/1092/雙2060-12g-加-2070-8g-llama.cpp-with-ornith-1.0-35b-heretic-mtp-apex-i-quality(TID:1092,异构多卡)
- 分享自己的經驗 # 7900 XTX 本地 LLM 優化實測報告(Qwen3.6-27B) — https://lcz.me/topic/151/151/分享自己的經驗-7900-xtx-本地-llm-優化實測報告-qwen3.6-27b(TID:151,雷电 3 vs OCuLink vs 原生 PCIe 实测阶梯)
- R9700 + Qwen3.8-27B:128K、MTP、Q4/Q6 都折腾了一遍 — https://lcz.me/topic/1345/1345/r9700-qwen3.8-27b-128k-mtp-q4-q6-都折腾了一遍(TID:1345,OCuLink 实测与带宽讨论)
- Strix Halo本地部署 DeepSeek V4 Flash — 環境、失效、可行與技術總結 — https://lcz.me/topic/1010/1010/strix-halo本地部署-deepseek-v4-flash-環境-失效-可行與技術總結(TID:1010,Blackwell + USB4 + Linux CUDA 兼容性问题)