现在总有人说,本地部署模型可能越来越没必要了——在线模型那么便宜,调用一次没几个钱,何必自己折腾硬件。之前这话大体没错,但最近情况有点变化:有的在线模型突然涨价了。价格一涨,成本优势打了折扣,本地部署这事就又被拿出来讨论。
而且现在的本地模型确实不是当年的水平了。今天能在自己机器上跑起来的开源模型,能力上可能已经超过了前些年令人非常惊艳的那些模型——当年的 GPT-3.5 刚出来的时候多轰动啊。所以这篇就把当年的 GPT-3.5、Qwen3.6 和最新的 Qwen3.8 拉到一起比一比。
顺便也想澄清一个误区:不是最新的模型在所有场景下都比旧模型强。就拿工具调用来说,默认模板下 3.6 有时候的表现反而比 3.8 要好一些。版本号不见得就决定一切。
先声明:这篇里所有的数据,都只是在我个人的设备的 7900xtx 24G 上跑出来的结果。环境是个例,样本量也小,不具有太多的参考意义,更不能代表模型的官方或普遍水平。
之前写过 Qwen3.8-27B 从 f16 到 IQ1_S 的量化阶梯,那篇说的是部署和速度。这篇只聊能力:把手头 3.6 和 3.8 两代 27B 的各种量化版、去审查版拉出来,用 BFCL V4 工具调用和六个经典基准统一测一遍,再看看本地模型替代在线 API 这事到底靠不靠谱。
先说结论:
- 单轮工具调用,默认模板下 3.6 反而比 3.8 强。3.6 官方 Q5hyb 拿到 89.44%,是全场最高,比 3.8 最好的配置高出 2.6 分以上。
- 两个家族都全面追平或超过 GPT-3.5。七个维度没有一个落后的,HumanEval 甚至是 100 对 48.1。
- 去审查不是免费的。3.6 的去审查版几乎无损(-0.21),3.8 的去审查版在"该不该调用工具"的判断上直接崩到 47.92%。
- 多轮工具调用两个都不太理想,复杂的智能体流程费劲了,当然可能主要是显存有限,上下文没给够。
一、测了什么,怎么测的
环境还是那套:llama.cpp 走 Vulkan,AMD 7900XTX 24G 主力。推理参数 --temp 0,关闭思维链,保证结果可复现。这篇不谈速度,速度的事在量化阶梯那篇里已经说过了。
受测的六个主力配置:
| 配置 | 体积 | 说明 |
|---|---|---|
| 3.6 官方 Q4_K_M | 17.0GB | 官方权重常规量化 |
| 3.6 官方 Q5hyb | 19.4GB | Q6/Q5 主体 + Q8_0 注意力 + Q8_0 MTP 的定制混合量化 |
| 3.6 去审查 Q5hyb | 19.4GB | huihui 微调 / Heretic 消融 |
| 3.8 官方 Q4_K_M | 16.8GB | 官方权重常规量化 |
| 3.8 官方 Q5hyb | 20.6GB | 同上定制混合量化 |
| 3.8 去审查 Q5hyb | 19.4GB | huihui 微调 / Heretic 消融 |
Q5hyb 是个什么东西
表格里反复出现 Q5hyb,值得单独说一下。这是我自己做的一个定制混合量化,名字就是 Q5 级混合(hybrid)的缩写。
出发点很简单:Q4_K_M 够小,但质量上总觉得还能再往上够一档;可直接上 Q6_K、Q8_0 又太大——27B 的模型,Q8_0 要 27 GiB,24G 卡物理上装不下,Q6_K 也有 20.9 GiB,塞进去之后留给 KV cache 和上下文的空间就很紧了。那就别一刀切:不同的张量对精度的敏感度本来就不一样,分开给。
设计思路一句话:好钢用在刀刃上。
- 注意力部分保 Q8_0。注意力是整个模型里对精度最敏感的部分,Q/K/V 投影有点误差,模型"看到"的东西就变了,这块不能省。
- MTP 层也保 Q8_0。这层体积很小,但它是投机解码的草稿层,草稿质量直接决定接受率,也就是决定提速效果。保 Q8,质量速度两头都不亏。
- 主干 FFN 用 Q6/Q5 混合。FFN 占的参数量最大,但对精度相对宽容,往下压一档,体积省得最明显。
做法跟之前那篇里的 Q8SLIM 是同一个路子:llama-quantize 的 --tensor-type 参数可以按张量名分别指定量化类型。
出来的效果:3.8 的 Q5hyb 20.6GB,单张 24G 卡装下之后还有富余;3.6 的 Q5hyb 在这次测试里是全场总分第一的配置(BFCL 89.44%,MMLU、WinoGrande 也是第一)。
测试分两块:
一块是 BFCL V4,专门测工具调用(function calling)的,这是现在本地模型最被看重的能力之一。测了 Non-Live AST 七类、Live 真实 API、Multi-turn 多轮三部分。
另一块是六个经典基准:MMLU(知识)、HumanEval(代码)、GSM8K(数学)、HellaSwag(常识)、ARC(科学推理)、WinoGrande(语义),每个采样 30 题,题面和评分复用之前的评测框架。
GPT-3.5 的成绩全部来自公开文献:前六维取 GPT-4 Technical Report 的 Table 2(OpenAI 自己公布的),BFCL 取 ToolN1 ICLR'26 论文里 BFCL V4 2025-04-13 快照的数据。
二、BFCL V4:3.6 全面压过 3.8
2.1 Non-Live AST 总览
| 模型 | Non-Live AST | vs GPT-3.5 |
|---|---|---|
| 3.6 官方 Q5hyb | 89.44% | +11.4 |
| 3.6 去审查 Q5hyb | 89.23% | +11.2 |
| 3.6 官方 Q4_K_M | 88.27% | +10.3 |
| 3.8 去审查 Q5hyb | 86.81% | +8.8 |
| 3.8 官方 Q4_K_M | 86.00% | +8.0 |
| 3.8 官方 Q5hyb | 85.08% | +7.1 |
参照线:GPT-3.5-Turbo-0125 的 BFCL V4 Non-Live Overall 约 78.0%。也就是说,这六个本地量化版里最"差"的一个,也比 GPT-3.5 高 7 个点。再提醒一句:这只是我个人设备上跑出来的结果,不具有太多参考意义。

2.2 拆开看:输在哪,赢在哪
总分只是一个数,拆开按类别看才有意思:
| 类别 | 3.6 家族 | 3.8 家族 | 谁赢 |
|---|---|---|---|
| simple_python | 95.75~96.25 | 96.25~97.0 | 3.8 略胜 |
| simple_java | 63~65 | 65~66 | 半斤八两 |
| simple_javascript | 74~76 | 70~78 | 半斤八两 |
| multiple(多函数选一) | 94.0~95.0 | 96.5 | 3.8 |
| parallel(并行调用) | 90.5~92.0 | 81.0~90.5 | 3.6 |
| parallel_multiple | 91.0~92.5 | 79.0~84.0 | 3.6 明显 |
| irrelevance(识别无可用函数) | 90.0(全员) | 70.4~76.7 | 3.6 明显 |
规律很清楚:单次调用、从一堆函数里挑一个这种"简单活",3.8 做得稍好;一旦要一次并行调多个函数,或者要判断"这个请求根本没有合适的函数、应该拒绝调用",3.6 的优势就出来了,parallel_multiple 上差了将近 10 个点。
irrelevance 这一项值得单独说。它测的是模型会不会"没活硬干"——给一个和所有函数都不沾边的请求,看模型是老实说没有合适工具,还是硬编一个调用出来。3.6 所有版本都稳在 90%,3.8 官方版本只有 70 出头。这个能力在真实 agent 场景里很要命:工具列表一大,模型要是见什么都想调,整个流程就会被幻觉调用带偏。
2.3 Live 与 Multi-turn
Live(真实 API 子集)只有 Q4 系列跑了完整数据:
| 模型 | Live Overall |
|---|---|
| 3.6 官方 Q4_K_M | 82.16% |
| 3.8 Q4_K_REC v22 | 82.16% |
| 3.8 官方 Q4_K_M | 81.72% |
| 3.8 Q4_K_REC | 80.98% |
Live 上两家基本打平,差不到半个点。顺带一提,3.8 还有两个 Q4_K_REC 变体配置也跑了,成绩都在 80.98~82.16 这个区间里,和官方 Q4_K_M 没有本质区别。
Multi-turn 就没什么好说的了,全员拉胯:
| 模型 | Multi-turn Overall | Base 子项 |
|---|---|---|
| 3.6 官方 Q4_K_M | 18.50% | 74.0% |
| 3.8 官方 Q4_K_M | 17.25% | 69.0% |
| 3.8 Q4_K_REC | 16.25% | 65.0% |
多轮工具调用要求模型在状态不断变化、函数缺失、参数缺失的情况下持续做正确决策,18% 这种成绩说明两代模型离"可靠的 agent 大脑"都还有距离。这点后面讨论替代在线模型时还要提。
三、七维能力雷达 vs GPT-3.5
六个基准加 BFCL,凑七个维度:
| 模型 | MMLU | HumanEval | GSM8K | HellaSwag | ARC | WinoGrande | BFCL |
|---|---|---|---|---|---|---|---|
| 3.6 官方 Q4_K_M | 70.0 | 100.0 | 100.0 | 86.7 | 93.3 | 83.3 | 88.3 |
| 3.6 官方 Q5hyb | 73.3 | 100.0 | 100.0 | 90.0 | 93.3 | 86.7 | 89.4 |
| 3.6 去审查 Q5hyb | 70.0 | 100.0 | 100.0 | 93.3 | 93.3 | 80.0 | 89.2 |
| 3.8 官方 Q4_K_M | 66.7 | 100.0 | 96.7 | 93.3 | 100.0 | 83.3 | 86.0 |
| 3.8 官方 Q5hyb | 70.0 | 100.0 | 96.7 | 90.0 | 100.0 | 83.3 | 85.1 |
| 3.8 去审查 Q5hyb | 66.7 | 100.0 | 93.3 | 86.7 | 100.0 | 83.3 | 86.8 |
| GPT-3.5-Turbo | 70.0 | 48.1 | 57.1 | 85.5 | 85.2 | 81.6 | 78.0 |

几个要点:
全部六个量化版在七个维度上没有一个低于 GPT-3.5 的。差距最大的是 HumanEval,100 对 48.1——当然这里要说明,30 题的 HumanEval 子集全对,和官方 164 题全量不是一回事,但起码说明代码生成这块,本地 27B 量化版完全不虚三年前的 GPT-3.5。GSM8K 同理,93.3~100 对 57.1。
最接近的是 MMLU,66.7~73.3 对 70.0,基本持平。知识面这种东西跟参数规模和训练数据强相关,追平就是追平,没什么可吹的,也没输。
3.6 官方 Q5hyb 是全场唯一在多数维度领先的配置,MMLU、WinoGrande、BFCL 三项第一。3.8 家族则在 ARC 上全员满分。
由于时间有限,所以每维只有 30 题,统计方差大约 ±9%,维度之间 5 分以内的差异不具备显著性。HumanEval 和 GSM8K 又都摸到了满分天花板,区分度为零。所以这张雷达图能说明"追平并超过 GPT-3.5"这个定性结论,但应该是不能拿小数点做严格比较。而且这一切都只是在我个人的设备上、用我这套环境跑出来的,换个环境未必是这个样子,参考意义有限。
四、3.6 对 3.8:同门对决
把两代模型的差异单独拎出来:
3.6 赢的地方:
- BFCL Non-Live 总分,89.44 对 85.08~86.81,全场前三被 3.6 家族包揽。
- 并行调用(parallel、parallel_multiple),这是真实工作流里最常见的模式。
- irrelevance 检测,90 对 70 出头,质的差距。
- WinoGrande 和 MMLU(Q5hyb 配置下)。
3.8 赢的地方:
- multiple 单选,96.5 对 94~95。
- simple_python / simple_java 单函数调用,略高。
- ARC 满分对 93.3。
量化敏感度的方向也不一样:3.6 是 Q5hyb 比 Q4_K_M 好(89.44 对 88.27),3.8 反而 Q4_K_M 比 Q5hyb 略好(86.00 对 85.08)。这个反向差异在 ±9% 的样本方差里未必站得住,但至少说明两代模型对量化方式的响应不一样,不能拿着一代的经验直接套另一代。
总的判断:这次测试用的是默认模板。在默认模板下,如果你的主要用途是工具调用、agent 类任务,3.6 有时候的表现反而比最新的 3.8 要好,而且不是险胜;3.8 的优势集中在单函数调用和科学推理这种单点能力上。所以别迷信版本号,不是最新的模型在所有场景下都比旧模型强——这代 3.8 在 BFCL 上就是实打实的退步。当然,这也只是我个人设备上的结果,仅供参考。
五、去审查的代价:两家完全不一样
去审查(去对齐)版本是本地社区的特色需求。这次测的两个去审查版,走的是 huihui 微调和 Heretic 消融的路子。结果非常有意思:
3.6 去审查版:BFCL 89.23,比官方版 89.44 只低 0.21,irrelevance 检测保持 90%,七个基准维度的波动全在方差范围内。可以说能力基本无损。
3.8 去审查版:BFCL 总分 86.81,看着甚至比官方 Q5hyb 的 85.08 还高一点,但拆开看就露馅了——irrelevance 检测从 70 多直接掉到 47.92%,腰斩都不止。也就是说,去审查之后的 3.8 变得"特别乐于助人":不管请求跟工具沾不沾边,都倾向于调用一个函数试试。multiple、parallel 这些类别它甚至还略有提升,但"该拒绝时拒绝"的能力基本丢了。
这个对比说明一件事:去审查对能力的影响不是个固定的"损耗百分比",它取决于对齐微调动的是哪块。3.6 的去对齐做得干净,3.8 的去对齐把工具调用的边界感也一起消融掉了。选去审查版本之前,最好先想清楚自己要的是什么——如果是拿来跑 agent,一个不会拒绝的模型可能比一个偶尔拒绝的模型更危险。
六、本地模型能不能替代在线模型
这是绕不开的问题。先限定讨论范围:这里的"在线模型"参照是 GPT-3.5-Turbo,也就是 2023 年初的水平,很多 API 场景至今还在用的那个档次。
从这次的数据看,替代是成立的:
七个能力维度全部追平或超过,工具调用超出 7~11 个点。对于"调 API 做单轮任务"这类需求——翻译、抽取、格式转换、单函数工具调用——本地 27B 量化版给出的质量不低于 GPT-3.5 档次的在线服务,而且数据不出本地、零调用成本、断网也能跑。数据敏感的场景里,这本身就是决定性的优势。
但有三条边界要说清楚:
第一,GPT-3.5 是个三年前的靶子。赢了它也远不能比现在的旗舰在线模型,都不用说那些闭源的,就连开源的GLM5.3、DeepSeek V4 等等更大规模参数的开源在线模型的推理和长文本能力,本地这种 27B 的小模型也还差得远。
第二,多轮是硬伤。Multi-turn 18% 的成绩意味着"模型自己规划、连续多轮调工具、处理异常"这种复杂 agent 流程,我这台设备上用当前的参数恐怕目前撑不起来。这类任务要么继续用在线旗舰模型,要么自己在框架层做大量兜底。
第三,样本量的限制。30 题的基准只能给出定性结论,真要下"全面替代"的判断,得上全量测试。这篇的结论是"能力上够格",不是"统计上严格证明"。
第四,也是最根本的一条:以上所有数字都只是在我个人的设备上跑出来的,不具有太多参考意义。替代成立与否,最终要在你自己的环境里验证。
不过,总体来看,本地模型好歹也达到替代 GPT-3.5 的能力了。
七、总结一下
- 工具调用选 3.6,官方 Q5hyb 是全场最佳配置,89.44%。
- 3.8 在单函数调用和 ARC 上有优势,但 BFCL 总分对 3.6 是退步。
- 对 GPT-3.5:七维全胜或持平,本地替代在单轮任务上成立。
- 去审查:3.6 几乎无损,3.8 的 irrelevance 检测崩到 47.92%,选之前想清楚。
最后再强调一遍:以上所有数据都只是在我个人的设备上跑出来的结果,不具有太多参考意义,看个思路就好。