本地跑模型的显卡怎么选?从2000到2万的价位全景指南

本地跑模型的显卡怎么选?从 2000 到 2 万的价位全景指南

前面两篇分别聊了 24G/32G 怎么选、以及本地部署到底值不值得。这一篇把"显卡本身"摊开:本地跑模型到底有哪些卡能选?按预算怎么排?本文只用一个统一的尺子——跑社区最主流的 Qwen 27B(以及少量 35B MoE)的真实速度——把 2000 元的入门卡到几万元的 AI 小主机这些路线全部标出来,并给出每一档适合谁。速度数字都是从论坛实测信息中总结出来的,出处编号见文末;价格行情则是 2026 年 9 月 13 日在淘宝、闲鱼上检索到的实际挂牌价,仅供参考。

先说四个选卡的前提

在罗列显卡之前,有四件事必须先讲清楚,否则下面的数字你会看不懂:

  1. 跑 27B 是社区统一的"尺子"。 目前本地部署最主流的模型是 Qwen3.6 / 3.8-27B(Q4 量化约 16-17GB),论坛几乎所有显卡实测都拿它当基准[6]。比它小的是 14B 及以下,比它大的是 35B-A3B(MoE)、120B 级大模型。
  2. 同一张卡速度能差一倍,关键看三样:投机解码(MTP/DFlash/EAGLE)开不开、上下文开多大、思考链开几档[6]。下面标注的速度都尽量注明条件。
  3. 显存容量 > 速度。 显存不够直接"跑不起来",速度只是快慢问题。选卡第一件事是算清楚你的目标模型量化后多大、要开多少上下文[3]。
  4. 价格是浮动的。 二手市场(3090、7900XTX、2080Ti 魔改)价格波动很大,以下价格为 2026 年 9 月 13 日查到的大致区间。价格随时可能变化,甚至几天一个价,入手前请务必到淘宝、闲鱼等平台查一下当时的实际成交价,不要照搬本文数字。[1][9]

先看行情:各卡价格速查(2026 年 9 月 13 日)

在展开各档位之前,先把当天在淘宝(新卡/拆机)和闲鱼(二手个人)上检索到的价格列出来,方便对照。同一型号价差极大,主要看成色、是否魔改、有无保修、是不是拆机/矿卡。

显卡 淘宝(新卡 / 拆机) 闲鱼(二手个人)
RTX 3060 12G 2100-3500(典型 2700) 1600-2200(典型 1950)
Tesla P40 24G 1269-1280 1200-1400
2080Ti 22G 魔改 2600-2800 2500-2600
RTX 5060Ti 16G 3600-4900 基本无整卡
RTX 3090 24G 拆机 3600-5100;公版新 8400-8600 7300-8800(典型 7600-8000)
RX 7900XTX 24G 新卡 5400-8700 4800-6400(典型 5000-5600)
Radeon AI PRO R9700 32G 新卡 11000-16000(常见 11500-14000) 仅见工程样品
RTX 4080S 32G 魔改 9000-15000 基本无整卡
4090D 48G 魔改 20000-27000 多为扩容服务,非整卡
RTX 5090 32G 新卡 28000-48500 二手 5090D 23400-23500
RTX PRO 6000 41438-217799(84G 版 4-7 万;96G 版 13-22 万)
MI210 64G 拆机 4000 / 全新 18500 3999-4000
NVIDIA DGX Spark(GB10 整机) 22959-44800(典型 33000-36000) 基本无整机挂单
AMD AI Max+ 395(Strix Halo 整机) 12499-28999(典型 16000-18000) 多为 CPU 散片/定金,非整机

这张表能看出两个关键信号:一是二手 3090 已经明显涨价,闲鱼个人卡普遍 7600-8000 元,和当年 4500-5500 元的行情完全是两回事;二是 7900XTX 二手反而比 3090 便宜(4800-6400),单卡速度还更快,差距只剩在 A 卡生态上。下面各档位的取舍都会围绕这两点重新说明。

第零档:入门试水(2000 元以内)

预算极低、只想先感受"本地模型"是什么感觉,不想一上来花大钱。

方案 显存 能跑什么 实测 一句话评价
二手 RTX 3060 12G 12GB 7-14B 完全体;27B 勉强(要 CPU offload) CUDA 省心,最便宜的入坑卡
Tesla P40 24G(洋垃圾) 24GB 27B Q4 能跑 35B-A3B Q5 约 45-60 t/s(配 2080Ti 缝合)[2] 被动散热、无视频输出,纯计算卡,折腾门槛高[2]

论坛里对洋垃圾(P40、V100、CMP170HX)的主流态度:不是不能玩,而是"买来跑推理都算踩坑"——显存数字好看,但每一步都在跟驱动、散热、平台兼容搏斗,调试成本远超省下的钱[12]。真想稳定大显存,社区验证过的路还是正常卡或 3090 双卡。

第一档:丐版双卡(4000-8000 元)——低预算的性价比之王

这一档是论坛讨论最热烈的地方,核心思路是"用两张便宜的 N 卡凑显存"。

双 RTX 3060 12G(约 4000 元) 论坛名帖"最丐 Qwen3.6-27b",两张 3060 合计约 4000 元(二手 3060 12G 闲鱼约 1900-2200 元/张),实测 27B Q4:MTP 开 43-50 t/s、关闭 MTP 31-36 t/s,prefill 稳定 600 t/s 上下。结论是"速度极其稳定、GPU 占用率长时间 100%,CUDA 就是成熟"[1]。双 16G 的 4060Ti/5060Ti 效果更好。

双 RTX 2080Ti 22G 魔改(约 5000-5300 元) 魔改 22G 的 2080Ti 是另一条路。双卡实测 27B:decode 60-82 t/s、prefill 约 1000 t/s(llama.cpp TP)[11][17]。也有单卡 TP2 跑 27B-FP8 的实测,decode 60-106 t/s、prefill 1100-1300 t/s[17]。2080Ti 有 NVLink,双卡通信比纯 PCIe 好。缺点是魔改卡有翻车风险、无官方保修。

双 RTX 5060Ti 16G(约 7200-8000 元) Blackwell 新卡,两卡合计 32GB。实测 vLLM TP 模式 35-78 t/s、LM Studio 实际 26-50 t/s[7]。新卡有保修、能效好,但价格已接近单张二手 3090。论坛观点:"双 16G 卡虽然性价比下降,但 CUDA 发挥稳定,效果更好"[1]。

这一档小结: 双 N 卡是社区公认最省心的丐版路线。按 9 月 13 日的行情,双 3060 合计约 4000 元,仍是最便宜的双卡入坑方案;双 2080Ti 22G 约 5000-5300 元;但双 5060Ti 已经要 7200-8000 元,接近一张二手 3090,"极致便宜"的标签主要留给前两个组合。另外要注意——双卡跑单模型要走 TP/张量并行,速度不是 2 倍,约 1.3-1.5 倍,且 PCIe 通信有开销;跨卡调度在写代码这类频繁交互场景延迟明显[1][4]。

第二档:24G 单卡主力(5000-8000 元)——最主流的选择

如果只想插一张卡、不想折腾双卡,这一档是绝对主流。

二手 RTX 3090 24G(闲鱼个人卡约 7600-8000 元 / 淘宝拆机 3600-5100 元) CUDA 生态 + 24G,本地跑 27B 的"最省心单卡"。实测 27B:MTP 开约 55-70 t/s、168K 上下文稳定,思考态 45-60 t/s[6]。论坛大量"3090 24G 单卡"实战帖,工具调用、长上下文都验证充分[6]。但要提醒一句,3090 这一年涨得很凶:闲鱼个人自用卡普遍报到 7600-8000 元,淘宝上 3600-5100 元的便宜货基本是拆机/矿卡,水深,功耗也高(350W)[6]。

RX 7900XTX 24G(二手约 4800-6400 元 / 新卡 6500-8000 元) 24G 大带宽卡,游戏旗舰定位。实测 27B Q4:不开投机约 39 t/s,Vulkan+MTP 后 51-73 t/s(工具调用 73.4 t/s),prefill 约 587 t/s[8][9]。速度是 24G 档里最能打的,但 A 卡要吃 ROCm/Vulkan 生态的折腾成本[9]。这里出现了一个"价格倒挂":7900XTX 二手已经比 3090 便宜(4800-6400 对 7600-8000),单卡速度还更快,唯一的门槛就是 A 卡生态[9][14]。

这一档怎么选: - 想要省心、驱动稳定、双卡扩展潜力 → 3090(但二手已涨到 7600-8000,预算要留够) - 想要单卡最高速度、且愿意折腾 A 卡 → 7900XTX(二手 4800-6400,如今反而更划算)

第三档:32G 大显存(9000-16000 元)——面向长上下文与更高精度

显存上到 32G,意味着 27B 能开 Q6/Q8 高精度、或 128K-256K 长上下文,还能跑 35B-A3B 这类 MoE。

Radeon AI PRO R9700 32G(全新约 11000-16000 元) RDNA4 新卡,32G 大显存。实测 27B Q4:约 27.6 t/s(不开投机)、MTP 优化后 35-50 t/s[15][16];vLLM 特调(MXFP4+DFlash2)下 prefill 能到 2000-3300 t/s、decode 思考态 40/编程 70-80 t/s[5]。速度不如 7900XTX,但胜在 32G 大显存 + 新卡保修 + ROCm 支持比 RDNA3 更好——长上下文、高精度量化、ComfyUI 视频是它的主场[9][15]。

RTX 4080S 32G 魔改版(约 9000-15000 元) N 卡 32G 的魔改路线。实测 llama.cpp + MTP:decode 中位约 89 t/s(不开投机仅 31)、冷 prefill 约 1900 t/s,307K 统一上下文池——32G 卡里相当能打[13]。与 R9700 价格接近,"N 卡生态 + 32G"是它最大的卖点,但魔改卡无官方保修,看运气[13]。

这一档怎么选: - 要 N 卡生态 + 32G + 高速度 → 4080S 32G 魔改(接受无保修风险) - 要新卡保修 + 32G + A 卡生态能忍 → R9700(A 卡生态当前最强 4 代)

第四档:48G 高端(15000-27000 元)——为"更大模型"铺路

上了 48G,27B 只是热身,真正的价值是能跑更大模型、开更长上下文、或跑 ComfyUI 视频生成不打架。

双 RTX 3090 NVLink(约 15000-16000 元) 论坛验证最充分的高端方案。双 3090 + NVLink 实测 27B:vLLM + AWQ-INT4 + MTP 工具调用 130 t/s、262K 上下文全开[10];SGLang 版常规对话 88 t/s、中文散文 178 t/s[18];半年实测 4 用户并发饱和 258 t/s[3]。48G 显存让 27B 开满上下文毫无压力,还能给多用户/多 Agent 用。不过双 3090 也跟着涨价:按闲鱼单张 7600-8000 元算,两张加 NVLink 桥就是 15000-16000 元,仍比 4090D 48G 单卡(20000-27000)便宜,但"性价比最高"已经要打个折扣[6][10]。

4090D 48G 魔改(约 20000-27000 元) 单卡 48G。实测 27B W4A16-AWQ + SGLang + DFlash2:平均 110 tok/s[4];FP8 版本 63-76 t/s。单卡 48G 意味着不用双卡、没有跨卡开销,部署最省心,但魔改卡贵且无官方保修[4]。

这一档怎么选: - 预算敏感、能接受双卡折腾 → 双 3090(价格较低、可扩展) - 不想折腾、要单卡省心 → 4090D 48G 魔改

第五档:旗舰与专业卡(2.8 万元以上)——追求极致或有特殊需求

RTX 5090 32G 当前消费级最强。实测 27B:NVFP4 单请求 decode 中位 143 tok/s、MTP 结构化输出 219.8 t/s,prefill 8000+ t/s;3 并发满载每路 146 t/s[19][20]。新卡约 2.8-4.5 万元,二手 5090D 约 2.3-2.4 万元。适合预算无上限、追求"本地接近在线体感"的人。

RTX PRO 5000/6000(48G+,专业卡) 48G 起步、有 ECC 与专业驱动。论坛实测 RTX PRO 5000 48G 跑 27B 约 55-65 t/s 量级。适合企业/生产力场景,价格昂贵(PRO 6000 现货约 4-22 万,84G 版 4-7 万、96G Blackwell 版 13-22 万,更多人选择卖掉换 3 张 R9700)[21]。

MI210 64G / A100 / L20(数据中心卡) 论坛对 MI210 的态度很鲜明:"入手就是退役期,生态走到末期,社区主流支持 CDNA3/RDNA3",除非 SR-IOV 等特殊需求,否则不推荐[14]。A100 40G、L20 96G 同理——买新不买旧,软件支持永远优先给新架构。

Mac 统一内存路线(M4/M5 系列) Mac Studio M5 Ultra 256G 能跑 170GB 级别的 DeepSeek-V4 开源模型(几十 t/s)[22]。适合需要超大统一内存、且生态(MLX)能接受的用户;但"统一内存并非万能",跑大模型性价比不如同价位 PC[23]。

另一条路:AI 小主机(DGX Spark / AI Max 395)

除了插显卡,这几年还多了一条"统一内存小主机"的路线:CPU 与 GPU 共享一整块大内存,显存不再是瓶颈,代价是内存带宽普遍偏低。论坛最近讨论最多的就是 NVIDIA DGX Spark 和 AMD Ryzen AI Max+ 395 这两台,值得单独说。

NVIDIA DGX Spark(GB10,淘宝约 2.3-4.5 万元,典型 3.3-3.6 万;闲鱼基本无整机挂单) 128GB LPDDR5X 统一内存、6144 CUDA 核心(48 SM)、带宽约 273-300 GB/s[24]。容量能装下 140B 级量化模型,但论坛的共识是它先撞的是带宽墙,而不是 128G 这个容量数字:27B Q4 激活约 15GB,理论上限也就 18 tok/s 左右,140B 级 MoE 更只有几 tok/s[24]。实测层面,单机跑 Qwen3.8-27B(SGLang + NVFP4 + DSpark)能到 34-38 tok/s,数学 43.6、代码 34 tok/s,但 prefill 不到 1000,冷启动要等 20-30 秒[25];4 台 DGX Spark 组 TP=4 跑 DeepSeek-V4.1-Flash,单条工作流 40-60 tok/s、三条 50-100 tok/s、prefill 2500-3000 tok/s[26];3 台就能装下 748B 的 V4.1-Flash 权重[27]。整体评价是"低功耗、安静、CUDA 原生,但单机跑大模型确实拉垮,更适合组集群"[25],论坛里也有专门提醒"新手不要碰 DGX Spark"[28]。

AMD Ryzen AI Max+ 395(Strix Halo,淘宝约 1.25-2.9 万元,典型 1.6-1.8 万;闲鱼多为 CPU 散片或定金,整机仍看淘宝) 集成 Radeon 8060S(40 CU / 2560 SP),128GB 统一内存,带宽约 215-260 GB/s[29]。它的性能上限比 Spark 更低,但价格便宜一大截。早期实测 Qwen3.6-27B:Q4_K_M 约 10-12 tok/s、Q8 约 7.5、BF16 只有 4.3 tok/s,prefill 要几分钟,当时的评价是"跑 Agent 会慢到吐血"[30]。转折出现在 2026 年 9 月,社区给 Strix Halo 做了一批定制优化(halogen-flash-server、ROCmFP4 + MTP、HaloGen),Qwen3.8-27B 的 decode 能到 40 tok/s 上下、prefill 突破 1000,长上下文曲线也不怎么掉[31][32][33],一下把它的性价比拉了起来。整机品牌有 FEVM FAEX1、极摩客 EVO-X2、铭凡 MS-S1 MAX、零刻 GTR9 Pro 等,淘宝价从 1.25 万一路到 2.2 万不等[29]。

这两台怎么选: - 要 CUDA 生态、能接受单机慢或愿意组集群 → DGX Spark(单机 3.3-3.6 万,集群才有意义) - 要便宜、能折腾 Linux/ROCm、主要跑 27B → AI Max 395 小主机(1.6-1.8 万,优化后速度可用) - 要更大统一内存、且接受苹果生态 → Mac Studio(见上一档,256G 可跑 170GB 级模型)

总对比表

以下是各价位主流方案的集中对比(基准模型:Qwen 27B Q4,速度区间取决于投机解码/引擎/上下文,请以条件为准):

方案 显存 市场价(元) 27B 实测速度 优势 短板 适合谁
P40 24G 洋垃圾 24G ~1200-1400 35B-A3B 45-60 t/s[2] 便宜、显存大 折腾门槛极高 折腾爱好者
双 3060 12G 24G ~4000 43-50 t/s[1] 极致便宜、CUDA 稳定 双卡通信、无扩展 预算最低的入坑者
双 2080Ti 22G 44G ~5000-5300 60-82 t/s[11][17] NVLink、大显存 魔改翻车风险 敢赌魔改的省钱党
双 5060Ti 16G 32G ~7200-8000 35-78 t/s[7] 新卡有保修 比 3090 组合贵 要保修的双卡用户
二手 3090 24G 24G ~5000-8000 55-70 t/s[6] 最省心单卡、CUDA 二手水深、功耗高 绝大多数人
7900XTX 24G 24G 二手4800-6000 39-73 t/s[8][9] 24G 里速度王 A 卡生态折腾 愿折腾的 A 卡玩家
R9700 32G 32G 11000-16000 27-50 t/s[15][16] 32G+新卡保修 速度一般 长上下文/高精度需求
4080S 32G 魔改 32G 9000-15000 约 89 t/s[13] N 卡生态+32G 魔改无保修 N 卡 32G 追求者
双 3090 NVLink 48G 15000-16000 108-178 t/s[3][10][18] 48G 里价格较低 双卡折腾 想上 48G 的玩家
4090D 48G 魔改 48G ~20000-27000 110 t/s[4] 单卡 48G 省心 贵、无保修 不折腾的高预算用户
RTX 5090 32G 32G 28000-45000 143-220 t/s[19][20] 消费级最强 极贵 预算无上限
RTX PRO 5000 48G 48G 4 万+ 55-65 t/s 专业卡 ECC 极贵 企业生产力
Mac M5 Ultra 256G 统一 ~8.6 万 数十 t/s[22] 超大内存跑大模型 贵、生态窄 特殊大模型需求
DGX Spark GB10 128G 统一 3.3-3.6 万 27B 34-38 t/s[25] CUDA、可组集群 带宽低、单机慢 要 CUDA 的集群玩家
AI Max 395 小主机 128G 统一 1.6-1.8 万 27B 约 40 t/s[31] 便宜、统一内存 带宽最低、要折腾 预算有限的折腾党

价格均为 2026 年 9 月 13 日在淘宝、闲鱼检索到的大致区间,价格随时会变,建议随时关注淘宝、闲鱼上的实际行情,以购买当天的成交价为准;"27B 实测速度"以论坛最常见配置为准,同一配置因投机解码与上下文设置会有明显差异,横向比较仅供参考,务必回原文看测法。

三句话总结

  1. 预算 4000-8000 → 双 3060 / 双 2080Ti / 双 5060Ti,双 N 卡是低预算路线的性价比之王,前提是你接受折腾双卡;
  2. 预算 5000-8000 只想插一张卡 → 3090(省心)或 7900XTX(最快),这是最主流、抄作业帖最多的一档;
  3. 想要长上下文/高精度/更大的模型 → 加钱上 32G(R9700 或 4080S 32G),再往上 48G(双 3090 价格较低、4090D 48G 更省心)

买卡没有标准答案,只有"你的预算 × 你要跑的模型 × 你愿意折腾多少"。量力而行,先跑起来,比什么都重要。


参考来源

本文全部实测数据来自论坛会员的真实装机分享,原帖链接均可点击核对测法:

  1. (双卡指南) 最丐 Qwen3.6-27b - 3000 元双 RTX 3060 - 50t/s — https://lcz.me/topic/328/328/双卡指南-最丐-qwen3.6-27b-3000-元双-rtx-3060-50t-s(TID:328)
  2. 双卡缝合怪 X99 平台 P40+2080Ti 的本地生产力平台 — https://lcz.me/topic/493/493/双卡缝合怪-x99平台-p40-2080ti的本地生产力平台(TID:493)
  3. 双 3090 NVLink + vLLM 半年实测:Qwen3.6-27B 解码 128 tok/s,并发 4 用户 258 tok/s — https://lcz.me/topic/988/988/双-3090-nvlink-vllm-半年实测-qwen3.6-27b-解码-128-tok-s-并发-4-用户-258-tok-s(TID:988)
  4. 4090 48GB SGlang+DFlash2 平均 110 tok/s 27B W4A16-AWQ — https://lcz.me/topic/1340/1340/4090-48gb-sglang-dflash2-平均-110-tok-s-27b-w4a16-awq(TID:1340)
  5. 單張 R9700 AI PRO 32G + VLLM + amd/Qwen3.8-27B-Quark-AWQ-MXFP4 — https://lcz.me/topic/1529/1529(TID:1529)
  6. 3090 24G 跑 QWOPUS 3.6 27B mtp 131K 上下文 KV(Q8_0) 55TOK/S… — https://lcz.me/topic/474/474/3090-24g-跑qwopus-3.6-27b-mtp-131k上下文-kv-q8_0-55tok-s-智能开关思考-最终配置-再也不折腾了-6月14日更新(TID:474)
  7. 技术分享:双卡 RTX 5060Ti Blackwell 运行 vLLM 与 LM Studio 性能实测报告 — https://lcz.me/topic/421/421/技术分享-双卡-rtx-5060ti-blackwell-运行-vllm-与-lm-studio-性能实测报告(TID:421)
  8. # 7900 XTX 跑 Qwen3.8-27B 實測 73.4t/s 完整部署與實測指南 — https://lcz.me/topic/1164/1164/7900-xtx-跑-qwen3.8-27b-實測73.4t-s-完整部署與實測指南-claude-code-opus5協助佈署的-分享給大家(TID:1164)
  9. 7900xtx vs r9700 llm 速度对比 — https://lcz.me/topic/349/349/7900xtx-vs-r9700-llm速度对比(TID:349)
  10. 双 3090 NVLink 跑 Qwen3.8-27B:vLLM + AWQ-INT4 + MTP,工具调用 130 t/s、262K 上下文全开 — https://lcz.me/topic/1245/1245/双-3090-nvlink-跑-qwen3.8-27b-vllm-awq-int4-mtp-工具调用-130-t-s-262k-上下文全开-附完整配置与-8-个踩坑(TID:1245)
  11. 双 RTX2080ti 22G nvlink llama.cpp 跑 Qwen3.8-27B 实战 — https://lcz.me/topic/1184/1184/双rtx2080ti-22g-nvlink-llama.cpp-跑qwen3.8-27b实战(TID:1184)
  12. CMP 170HX 显卡到底怎么样? — https://lcz.me/topic/1056/1056/cmp-170hx显卡到底怎么样(TID:1056)
  13. 4080S 32G 跑 Qwen3.8-27B:llama.cpp 优化全记录 + SGLang 探索踩坑 — https://lcz.me/topic/1404/1404/4080s-32g-跑-qwen3.8-27b-llama.cpp-优化全记录-sglang-探索踩坑(TID:1404)
  14. AMD Yes?它的显卡适合谁?MI210 是宝藏还是工业垃圾? — https://lcz.me/topic/1465/1465(TID:1465)
  15. 5700X + Radeon AI PRO R9700 32GB 简单测试 — https://lcz.me/topic/820/820/5700x-radeon-ai-pro-r9700-32gb-简单测试-求优化建议-换了3090(TID:820)
  16. AMD R9700 實測:ROCm 10,Qwen38-27B-UD-Q6_K、128K context 和 MTP — https://lcz.me/topic/1535/1535(TID:1535)
  17. 让你们看看垃圾魔改卡 2080ti 的威力 qwen3.6-27b fp8 — https://lcz.me/topic/772/772/让你们看看垃圾魔改卡2080ti-的威力-qwen3.6-27b-fp8-精度-速度能到-60tokens-s-nvlink-连接(TID:772)
  18. 双 3090 NVLink 从 vLLM 换到 SGLang 跑 Qwen3.8-27B:实测 108 t/s,262K 上下文全开 — https://lcz.me/topic/1366/1366/双-3090-nvlink-从vllm-换到-sglang-跑-qwen3.8-27b-实测-108-t-s-262k-上下文全开(TID:1366)
  19. RTX 5090 Qwen3.8-27B dsh 全套實測 — https://lcz.me/topic/1228/1228/rtx-5090-qwen3.8-27b-dsh-全套實測-自寫推理引擎-ninfer-deepseek-harness-開源編碼-agent-任務-跑-13-小時真實編程任務的數據-6-個坑-以及-並發不是越大越快(TID:1228)
  20. 3 並發 146 t/s @105K nvfp4:Qwen3.8-27B RTX 5090 滿載實測 II — https://lcz.me/topic/1462/1462/3並發146-t-s-@105k-nvfp4-qwen3.8-27b-rtx-5090-滿載實測-ii-全-nvfp4-450k-pool-419k-全上卡零-offload(TID:1462)
  21. RTX PRO6000 现货价格 10w,该不该卖,换 3 张 r9700 — https://lcz.me/topic/435/435/rtx-pro6000-现货价格-10w-该不该卖-换-3-张-r9700(TID:435)
  22. DeepSeek-V4-Flash-Vision-Exp 开源了,现在有跑本地的量化版本吗 — https://lcz.me/topic/1448/1448/deepseek-v4-flash-vision-exp-开源了-现在有跑本地的量化版本吗(TID:1448)
  23. M5 Max/Ultra AI 性能强悍?苹果、AMD、英伟达 AI 小主机 AI 性能全面分析(潜力很大但统一内存并非万能) — https://lcz.me/topic/1357/1357/m5-max-ultral-ai性能强悍-苹果-amd-英伟达ai小主机ai性能全面分析-潜力很大但统一内存并非万能(TID:1357)
  24. 想聽聽各路大神對RTX Spark的看法 — https://lcz.me/topic/1657(TID:1657)
  25. DGX单机也有春天——Qwen3.8-27B at 34-38 tok/s on DGX Spark (GB10) — https://lcz.me/topic/1188(TID:1188)
  26. Deepseek v4.1 flash, 4台DGX spark GB10, TP=4 — https://lcz.me/topic/1658(TID:1658)
  27. DeepSeek V4.1 Flash 552B权重翻倍,DGX Spark 3台可以装下权重 — https://lcz.me/topic/1611(TID:1611)
  28. 新手不要碰DGX Spark(重要事情说三遍) — https://lcz.me/topic/27(TID:27)
  29. 分享:4090/48G, R9700/32G, AI Max 395 (8060S) 跑大语言模型的实测数据 — https://lcz.me/topic/143(TID:143)
  30. 请问有没有人可以帮助提供 AMD AI MAX 395 跑Qwen3.6-27B的速度情况? — https://lcz.me/topic/713(TID:713)
  31. Aimax 395的定制qwen 3.8 flash,prefill突破1000了,decode 40-50 — https://lcz.me/topic/1609(TID:1609)
  32. ROCm FP4以 AI Max+ 395測試 對比Q4進步不小 — https://lcz.me/topic/1576(TID:1576)
  33. Halogen Flash Server配置與實測(AI Max+ 395 w Qwen 3.8 Flash Next) — https://lcz.me/topic/1659(TID:1659)