8G 显存怎么跑本地大模型?——从 RTX 2060 到 4070 的极限压榨实录

8G 显存怎么跑本地大模型?

16G 显存的取舍我写过一篇,这回把档次再往下压:手里只有一张 8G 的卡——RTX 3070、4060、2060 Super,或者 4070 Laptop 这种 8G 笔记本——还能不能跑本地大模型?技术上能跑,甚至能跑 35B;但"能跑"和"好用"之间隔还是有点远啊。本文全部数据来自真实实测,出处见文末。

一、先摆结论:8G 能跑 35B,但别高兴太早

先说反直觉的部分:8G 显存跑 35B 大模型,是可行的。论坛里至少四张不同的 8G 卡(3070、4060、2060 Super、4070 Laptop)都成功跑起了 Qwen3.6-35B-A3B,速度从 17 t/s 到 42 t/s 不等,甚至有人把 35B 塞进了 8G 笔记本还开出 128K 上下文[1][2][3][4]。

但同一批帖子里,楼主自己的评价是这样的:

  • "编码可以跑。能处理图片。其他的拉稀中。总结:学习机小拉拉一枚。"[1]
  • "这个小拉拉实际应用没有任何意义。或者直白点就是 8G 就是没什么意义。我的任意项目它都是跑不了的。"[1]
  • "8G 的卡只能是跑起来而已,用来驱动 agent 几乎不可用的。"[3]

为什么会有这种分裂? 因为 8G 的瓶颈从来不是"装不装得下模型",而是预填充(prefill)速度。日常聊天、短代码问答,体验尚可;一旦接上 Agent(比如 Hermes),系统提示词动辄 20K+ token,8G 卡的 prefill 就会慢到让人失去耐心[3]。

所以本文的正确读法是:8G 能带你入门、能跑通、能理解参数,但它不是生产力工具的上限,而是一个"折腾甜点"

二、核心原理:MoE + CPU Offload 是 8G 的救命稻草

8G 能跑 35B,靠的不是什么黑科技,而是架构红利

Qwen3.6-35B-A3B 是混合专家模型(MoE):35B 总参数,但每次推理只激活约 3B 参数[1]。这意味着 GPU 不需要一次性加载完整的 35B 权重。

再叠加 llama.cpp 的两个能力:

  1. CPU Offload(-ngl:控制多少层放 GPU,其余放内存;
  2. MoE 专家路由(--n-cpu-moe:把非激活的专家层丢到系统内存,GPU 只保留注意力层和少量专家[2]。

于是形成"GPU 跑注意力层、内存跑专家层"的分工——这才是 8G 卡能跑 35B 的核心原因[1]。代价是:速度上限被内存带宽锁死,因为每生成一个 token 都要从内存里搬专家权重。

反过来说:如果你用的是同尺寸的稠密(Dense)模型,比如 27B 稠密,那 8G 基本没戏——Q4 量化后权重就要 15GB 以上,根本放不下,硬 offload 会慢到不可用[5]。

三、模型怎么选:35B-A3B MoE,还是退一步用 9B

8G 上有两条路线,选哪条取决于你要干什么。

路线一:35B-A3B MoE——"能跑大模型"的执念

这是论坛里 8G 玩家最热衷的方向,因为"8G 跑 35B"本身就有巨大的心理满足感。实测也确实能跑:

  • RTX 3070 8G + i7-12700,Q4_K_M 量化,-ngl 99 --n-cpu-moe 999,32K 上下文,还支持多模态和网页 UI[1]
  • RTX 4060 8G + R7 5700X,APEX-MTP 量化(13.7GB),-ngl 999 --n-cpu-moe 32,64K 上下文,短输出 30+ t/s、代码场景 45-50 t/s[3]
  • RTX 4070 Laptop 8G,Q4_K_M,短文本 42.3 t/s、Thinking 模式 42.1 t/s,一键包支持 128K + 多模态[4]

路线二:9B 级稠密模型——"真的好用"的务实选择

论坛里不止一个人劝退"8G 硬上 35B":

"4060 还是玩 9B 吧……跑起来还快点。"[3]

在工具调用(function calling)这个对 8G 最关键的场景里,有会员给出了明确建议[5]:

8G(4070):27B 的 Q4 要 15G 以上,放不下。8G 实际能打的是 Qwen3-8B、GLM-4-9B(同尺寸里工具调用很强)、Gemma3-12B Q4 勉强压线。别为了"跑大模型"硬上 27B 的低量化档——如果只是翻译或者写文本倒是无所谓了,但工具调用对量化损伤很敏感,降档后 function call 格式会先崩

这句话很关键:Agent 场景下,"小模型满精度"往往打得过"大模型低量化"。因为工具调用要求模型稳定输出 JSON schema,低量化会先破坏这种结构化输出能力。

四、量化怎么选:8G 的量化比 16G 更极端

8G 上量化档位的选择空间比 16G 窄得多,但方向是一致的——找到能全层上卡、又不至于把质量整崩溃的那一档

论坛实测过的几档(35B-A3B):

量化 大小 8G 卡适配情况 出处
Q4_K_M 16.5 GB 权重就超 8G,必须重度 offload,能跑但吃力 [1][4]
APEX-MTP-I-Mini 13.7 GB 4060 上 30+ t/s、代码 45-50 t/s,8G 的"毕业配置" [3]
APEX-I-Quality ~16.8 GB 异构多卡(12G+8G)上 prefill 1279 t/s、decode 88.8 t/s [6]
IQ2_M 最小 2060 Super 上唯一能稳定跑 8K 上下文的档位,~17 t/s [2]
Q3_K_XL ~16.8 GB 需要 24G 以上才舒服,8G 上偏重 [3]

几个结论:

  1. 8G 上"精度换速度"是刚需。16G 上还能讲究 IQ4_XS 全层上卡,8G 上往往要一路降到 APEX/IQ2 级别,甚至接受"模型智商明显下降"[2]。
  2. APEX 量化是 8G 的惊喜。它把 35B 压到 13.7GB,配合 MTP(多 token 预测)能在 4060 上跑出 30+ t/s,被社区称为"8G 显存的毕业配置"[3]。
  3. 别迷信低量化能救一切。IQ2_M 虽然塞得下,但作者自己也说"完全没有意思""硬件限制上不到 16K"[2]——量化降到这个程度,模型能力已经受损。

五、关键参数:--n-cpu-moe-fit off

8G 跑大 MoE 模型,参数比模型更重要。论坛里一份"极限参数定稿报告"把调参过程完整记录了下来,非常有参考价值[2]:

阶段 1:默认参数(失败)

-ngl 80 -c 4096

现象:显存逼近 8G 爆满,报 failed to fit params to free device memory,llama.cpp 自动回退,速度断崖式跌到 ~7.5 t/s。

阶段 2:开启 MoE 专家路由(部分改善)

-ngl 80 --n-cpu-moe 38 -c 4096

显存降到 ~2.5G(异常偏低),速度 ~15 t/s。问题:GPU 层数被削太狠,大量权重滞留内存,瓶颈变成内存带宽。

阶段 3:强制显存适配 + 降 GPU 层数(关键突破)

-ngl 30 --n-cpu-moe 20 -c 4096 -fit off

显存 6.8G / 8G(余量 1.3G),速度 ~15 t/s。-fit off 关闭自动适配后,30 层权重成功驻留显存,进入甜点区。

阶段 4:上下文扩容(最终定稿)

-ngl 30 --n-cpu-moe 20 -c 8192 -fit off

显存 7.0G / 8G(余量 1.1G),速度 ~17 t/s。上下文翻倍,显存只多 200MB,速度反而微升

这份报告的核心经验[2]:

  1. --n-cpu-moe 是 8G 卡跑大 MoE 的核心参数,负责把非激活专家路由到内存;不能无脑 -ngl 80,要配合 -fit off 手动控制显存分配。
  2. 显存甜点区是 6.5G ~ 7.2G:低于 6G,GPU 层数不足、速度受限;高于 7.5G,余量不够,Windows 的 WDDM 驱动一波动就爆显存、速度断崖。
  3. Windows 的可用显存要比标称少:标称 8192 MiB,实际空闲只有 7158 MiB;同配置在 Linux 下预计能多出 500MB~1G,有望稳定 16K 上下文[2]。
  4. 上下文和速度不总是负相关:4K→8K 速度从 15 微升到 17 t/s,因为 4K 时 GPU 利用率没吃满,8K 反而让流水线更饱和[2]。
  5. Thinking 会偷偷吃掉 token:复杂 prompt 容易陷入长推理,建议前端加约束"请直接回答,不要输出思考过程"[2]。

另外,KV 缓存量化也是 8G 的必备技巧:--cache-type-k q4_0 --cache-type-v q4_0 能大幅省显存换上下文[1];如果显存还有余量,用 q8_0 质量更稳[3]。

六、实测数据的真实表现

把论坛里几张 8G 卡的实测数据放在一起看,差异非常明显:

显卡 CPU/内存 模型/量化 上下文 生成速度 备注
RTX 3070 8G i7-12700 / 64G 35B-A3B Q4_K_M 32K 编码可跑 多模态+UI,作者自称"学习机"[1]
RTX 2060 Super 8G i7-4790K / 32G DDR3 35B-A3B IQ2_M 8K ~17 t/s 极限定稿,甜点区 6.5-7.2G[2]
RTX 4060 8G(台式) R7 5700X / 64G 35B-A3B APEX-MTP 64K 30+ t/s,代码 45-50 prefill ~499 t/s[3]
RTX 4060 8G(USB4 笔记本) R7 6850HS / 32G 35B-A3B APEX-MTP 64K 同上但 prefill 慢 3 倍 prefill ~168 t/s[3]
RTX 4070 Laptop 8G i7-14650HX / 32G 35B-A3B Q4_K_M 128K 42.3 t/s 一键包,多模态+Agent[4]
4070 8G 笔记本 35B-A3B 35 t/s 成功接入 Hermes[1]

几个观察:

  1. 同是 4060 8G,台式机和 USB4 外接笔记本差 3 倍——差的不是 GPU 算力,而是 PCIe vs USB4 的带宽/延迟,以及移动 CPU 的持续功耗和内存带宽[3]。
  2. CPU 和内存同样重要:2060 Super 配 DDR3 只能跑 17 t/s,而 4060 配 DDR4-3200 能跑 30+;专家层跑在内存里,内存带宽直接决定下限[2][3]。
  3. 异构多卡是一条野路子:有人用双 2060 12G + 2070 8G 组异构,跑 35B APEX 量化,prefill 达到 1279 t/s、decode 88.8 t/s[6]——但这已经超出"单张 8G"的范畴了。

七、连接方式之争:USB4/雷电 vs OCuLink

先回答一个很多人搞混的问题:USB4 和雷电(Thunderbolt)到底是不是一回事?

答案是"同源但不等同"。Intel 当年把 Thunderbolt 3 的协议贡献给了 USB-IF,这套协议后来就成了 USB4(2019 年发布)。所以:

  • 雷电 3 / USB4 40Gbps / 雷电 4:底层是同一套协议,eGPU 走的都是 PCIe 3.0 x4 隧道(约 32 Gbps 可用、约 3.9 GB/s);
  • 雷电 4 只是 USB4 40Gbps 之上的更严格认证(强制 40Gbps、PCIe 隧道 ≥32Gbps);
  • 雷电 5 / USB4 v2 才把带宽拉到 80/120 Gbps(PCIe 4.0 x4 隧道)。

关键结论:所谓"USB4 不行",问题不在"USB4 比雷电差"——USB4 40Gbps 和雷电 3/4 的 eGPU 带宽本质是一样的。真正的瓶颈是这套隧道机制本身的开销和延迟,跟原生 PCIe 有先天差距[3]。换句话说,你换成雷电 3/4 的显卡坞,也不会比 USB4 好到哪去。

那什么更好?OCuLink

OCuLink(SFF-8611)走的是原生 PCIe 信号,不经 USB/雷电的协议封装(隧道),所以延迟更低;规格上常见 PCIe 3.0 x4(32 Gbps)或 PCIe 4.0 x4(64 Gbps)——后者是 USB4/雷电 3/4 的两倍带宽。代价是不支持热插拔、线缆不供电(要独立电源)、线短、还要占一个 M.2/PCIe 槽。

论坛里有一份同一张 7900 XTX 在不同连接方式下的实测阶梯,非常有说服力[7]:

连接方式 预期生成速度(tg mean)
雷电 3 eGPU(Razer Core X Chroma) 37–45 t/s
OCuLink 改装同一个坞(~$80,3 小时) 52–55 t/s
移到 X99 台式机(PCIe 3.0 x16) 58–62 t/s
现代 AM5 + PCIe 4.0 x16 67 t/s

OCuLink 比雷电 3 快了约 40%(37-45 → 52-55),几乎追平原生 PCIe 3.0 x16。所以对 eGPU 跑 LLM,OCuLink 是比雷电/USB4 更划算的选择。另有会员在 OCuLink + R9700 上实测 Q4 量化:pp512 达 680 t/s、tg128 约 29.5 t/s、开 MTP 长输出约 43 t/s,作者表示没观察到明显的链路瓶颈[8](不过他强调没有同卡 PCIe x16 的 A/B 对照,结论只能作参考)。

回到 8G 笔记本的场景,连接方式的影响同样明显[3]:

  • 台式机 PCIe 内置 RTX 4060:长 prompt processing ≈ 499 tok/s
  • 笔记本 USB4 外接 RTX 4060:长 prompt processing ≈ 168 tok/s(慢近 3 倍)

原因有四[3]: 1. USB4 eGPU 的带宽和延迟弱于台式机 PCIe; 2. 35B-A3B 依赖 CPU MoE,CPU/GPU 协作频繁,链路瓶颈被放大; 3. 移动端 CPU 的持续功耗、散热、内存带宽不如台式机; 4. 笔记本内存通常 32G,64K 上下文 + prompt cache + CPU MoE 时余量更小。

(补充一个兼容性坑:有会员反馈 Blackwell + USB4 + Linux CUDA 运算必崩,RTX 5090 eGPU 在 Linux 下无法启动[9]——外接显卡不光看带宽,还要看平台兼容性。)

笔记本的务实建议[3]: - 上下文降到 32K(ctx-size = 32768),n-cpu-moe 提到 35; - 或者干脆改用能完整放进 8G 的小模型(Qwen3.5-9B、7B/8B coder),避开 CPU MoE 的链路瓶颈; - 别把笔记本当主力 Agent 服务端; - 真要外接,优先考虑 OCuLink 而非雷电/USB4 显卡坞。

八、笔记本 4060 能逼近笔记本 4070?

回头看第六节的表,有个现象值得单独拆开:笔记本 RTX 4060(低一档的卡)居然和笔记本 RTX 4070(高一档的卡)打得不分上下——笔记本 4060 短输出 30+ t/s、代码 45-50 t/s[3],笔记本 4070 是短文本 42.3 t/s、Thinking 42.1 t/s[4]。按理说 4070 该碾压 4060,为什么会这样?

最重要的:笔记本 4060 和 4070 的显存带宽完全相同。

显卡 核心 CUDA 核 位宽 显存带宽
RTX 4060 Laptop AD107 3072 128-bit 256 GB/s
RTX 4070 Laptop AD106 4608 128-bit 256 GB/s
(对比)RTX 4060 桌面 AD107 3072 128-bit 272 GB/s
(对比)RTX 4070 桌面 AD104 5888 192-bit 504 GB/s

笔记本 4060 和 4070 都是 128-bit、16 Gbps 的 GDDR6,带宽都是 256 GB/s——4070 多出来的 1536 个 CUDA 核,并没有换来带宽提升。而 LLM 解码(decode)是"带宽瓶颈"型任务:每生成一个 token,都要把权重从显存完整读一遍,速度基本由显存带宽决定,而不是 CUDA 核数。带宽一样,解码速度自然就接近。

然后,频率差异又补了一刀——笔记本 4060 的加速频率反而更高。 这是很多人忽略的变量:AD107 核心数少、功耗密度低,反而能跑到更高的频率。官方规格里,RTX 4060 Laptop 的 Boost 频率约 2370 MHz,比 RTX 4070 Laptop 的约 2175 MHz 还高(部分高 TGP 机型 4060 能上到 2460 MHz,而 4070 大约封顶 2295 MHz)。用"核心数 × 频率"估有效算力:

显卡 核心数 Boost 频率 有效算力(核·MHz)
RTX 4060 Laptop 3072 ~2370 MHz 7.28 M
RTX 4070 Laptop 4608 ~2175 MHz 10.02 M

4060 的有效算力达到了 4070 的约 73%,而不是纯核数比给出的 67%——频率优势把差距从 33% 缩小到了约 27%。再考虑笔记本里持续负载下的实际频率(小核心更容易维持高频),差距还会进一步收窄。所以"核心数"这一项的影响力,被频率抵消了相当一部分;在带宽瓶颈的 decode 阶段,频率和核数都不太起作用,两者更是难分高下。

少得可怜的那点差距,用处也不大,因为多出来的核数只在 prefill 阶段有优势。 prefill(处理输入 prompt)是计算密集操作,有效算力(核心数 × 频率)更高的 4070 会快一些;但到了逐 token 输出的 decode 阶段,两者又被带宽拉回同一水平。所以"聊天的体感速度"(看 decode)差不多,只有"首字延迟"(看 prefill)4070 占优。

而且,两者都是笔记本芯片,功耗墙和散热限制相同。 4060 Laptop 和 4070 Laptop 的可配置功耗区间都是 35–115W,薄本里常年 60–80W 且会热降频。LLM 推理是持续负载,谁都没法长时间跑满,差距进一步被抹平。

最后,配置差异也在放大或缩小差距。 笔记本 4060 那组用了 APEX-MTP(带 MTP 投机解码,提速 30-50%),笔记本 4070 那组是 Q4_K_M、没提 MTP[3][4]。所以"4060 看起来不输 4070"里,有一部分是量化/MTP 配置的功劳,不全是硬件的。

反过来看桌面版就明白了:桌面 4060(272 GB/s)和桌面 4070(504 GB/s)带宽差了近一倍,档次差距立刻显现——桌面 4070 在解码上能明显碾压桌面 4060。笔记本 4060/4070 之所以"打平",本质是"同带宽、不同核数、但频率反超"三者叠加;桌面 4060/4070 则是"带宽差一倍",差距自然拉开。

一句话总结:选卡跑本地模型,先看显存带宽,再看有效算力(核心数 × 频率)。 笔记本 4060 和 4070 共享 256 GB/s 带宽,且 4060 频率更高、部分抵消核数劣势,所以在带宽瓶颈的 LLM 解码里难分高下。

九、8G 到底能干什么:Agent 场景的现实

这一节可能是新手朋友最关心的了。

能干的: - 日常对话、短代码补全、文本翻译; - 图片/视频问答(多模态,8G 也支持)[1][4]; - 轻量 Agent 任务(有会员在 4070 8G 笔记本上接 Hermes 成功执行多种任务)[1]; - 学习理解 MoE、offload、量化这些概念——8G 是最好的"教具"[2]。

干不动的: - Hermes 这类 Agent 的默认系统提示词就有 20K+ token。8G 卡 prefill 速度约 300 tok/s,光处理提示词就要等很久,实际使用"基本没什么效率可言"[3]; - 复杂多轮工具调用——量化降档后 function call 格式先崩[5]; - 长代码生成——输出长了会明显变慢,最好让 Agent 分文件、分阶段输出[3]。

一位带佬的总结很到位[3]:

8G 的卡只能是跑起来而已,用来驱动 agent 几乎不可用的。

所以对 8G 玩家,我的建议是把心态放对: - 想"跑通、学原理、发帖炫技"→ 35B-A3B MoE,尽情折腾; - 想"日常真的用起来"→ 老老实实用 9B 稠密 + 满精度,或者升级到 16G/24G; - 想"驱动 Agent 干正事"→ 8G 不够,这不是调参能解决的,是硬件天花板。

十、给 8G 玩家的一张速查表

你的诉求 推荐模型 量化 关键参数
就想跑通 35B 玩玩 Qwen3.6-35B-A3B APEX-MTP-I-Mini (13.7G) -ngl 999 --n-cpu-moe 32,KV q8_0
极限压榨(2060S 级) 35B-A3B IQ2_M -ngl 30 --n-cpu-moe 20 -c 8192 -fit off
日常对话/短代码 Qwen3.5-9B / 8B coder Q8_0 全层上卡,别 offload
工具调用/Agent Qwen3-8B / GLM-4-9B 高精度 别用 27B 低量化
多模态 35B-A3B + mmproj Q4_K_M --mmproj 加视觉文件
笔记本 9B 稠密 高精度 ctx-size 32768n-cpu-moe 35

三条铁律: 1. 8G 跑大模型,--n-cpu-moe-fit off 比模型本身更重要,显存控制在 6.5-7.2G 的甜点区; 2. 能跑 ≠ 好用,Agent 场景的瓶颈是 prefill,不是生成速度; 3. 别为了"跑大模型"硬上低量化,尤其工具调用场景,小模型满精度往往更实用。

8G 不是废物,它会让你清楚地看到显存、带宽、量化三者之间的取舍。折腾它,你能学会所有该学的;指望它,你会失望。理性折腾,量力而行。


参考来源

本文全部实测数据来自抡锤者(lcz.me)论坛会员的真实分享,原帖均可点击核对完整配置与测法:

  1. 8G显存 篇。RTX3070 8G显存。成功跑 Qwen3.6-35B 多模态AI大模型 — https://lcz.me/topic/262/262/8g显存-篇-rtx3070-8g显存-成功跑-qwen3.6-35b-多模态ai大模型(TID:262)
  2. RTX 2060 Super 8G 部署 Qwen3.6-35B-A3B 极限参数定稿报告 — https://lcz.me/topic/342/342/rtx-2060-super-8g-部署-qwen3.6-35b-a3b-极限参数定稿报告(TID:342,极限调参四阶段)
  3. 【RTX4060】【8G显存】运行Qwen3.6 35B A3B APEX-MTP包含两种方式及测试结果 — https://lcz.me/topic/213/213/rtx4060-8g显存-运行qwen3.6-35b-a3b-apex-mtp包含两种方式及测试结果(TID:213,台式机 vs USB4 笔记本、n-cpu-moe 调优)
  4. 开源个安装包Qwen3.6 35B 塞进了 8GB 显存笔记本:128K、多模态、Thinking,一键安装还能接本地 Agent — https://lcz.me/topic/1080/1080/开源个安装包qwen3.6-35b-塞进了-8gb-显存笔记本-128k-多模态-thinking-一键安装还能接本地-agent(TID:1080)
  5. 【请教】对于7900xtx-24G和4070-8G这类小显存显卡,进行工具调用的模型有什么评分之类的信息出处供参考么? — https://lcz.me/topic/1066/1066/请教-对于7900xtx-24g和4070-8g这类小显存显卡-进行工具调用的模型有什么评分之类的信息出处供参考么(TID:1066,8G 工具调用模型建议)
  6. 雙2060 12G 加 2070 8G llama.cpp with Ornith-1.0-35B-Heretic-MTP-APEX-I-Quality — https://lcz.me/topic/1092/1092/雙2060-12g-加-2070-8g-llama.cpp-with-ornith-1.0-35b-heretic-mtp-apex-i-quality(TID:1092,异构多卡)
  7. 分享自己的經驗 # 7900 XTX 本地 LLM 優化實測報告(Qwen3.6-27B) — https://lcz.me/topic/151/151/分享自己的經驗-7900-xtx-本地-llm-優化實測報告-qwen3.6-27b(TID:151,雷电 3 vs OCuLink vs 原生 PCIe 实测阶梯)
  8. R9700 + Qwen3.8-27B:128K、MTP、Q4/Q6 都折腾了一遍 — https://lcz.me/topic/1345/1345/r9700-qwen3.8-27b-128k-mtp-q4-q6-都折腾了一遍(TID:1345,OCuLink 实测与带宽讨论)
  9. Strix Halo本地部署 DeepSeek V4 Flash — 環境、失效、可行與技術總結 — https://lcz.me/topic/1010/1010/strix-halo本地部署-deepseek-v4-flash-環境-失效-可行與技術總結(TID:1010,Blackwell + USB4 + Linux CUDA 兼容性问题)