Qwen3.6 vs Qwen3.8:27B 量化与去审查版本能力全对比,以及本地模型能不能替代 GPT-3.5

现在总有人说,本地部署模型可能越来越没必要了——在线模型那么便宜,调用一次没几个钱,何必自己折腾硬件。之前这话大体没错,但最近情况有点变化:有的在线模型突然涨价了。价格一涨,成本优势打了折扣,本地部署这事就又被拿出来讨论。

而且现在的本地模型确实不是当年的水平了。今天能在自己机器上跑起来的开源模型,能力上可能已经超过了前些年令人非常惊艳的那些模型——当年的 GPT-3.5 刚出来的时候多轰动啊。所以这篇就把当年的 GPT-3.5、Qwen3.6 和最新的 Qwen3.8 拉到一起比一比。

顺便也想澄清一个误区:不是最新的模型在所有场景下都比旧模型强。就拿工具调用来说,默认模板下 3.6 有时候的表现反而比 3.8 要好一些。版本号不见得就决定一切。

先声明:这篇里所有的数据,都只是在我个人的设备的 7900xtx 24G 上跑出来的结果。环境是个例,样本量也小,不具有太多的参考意义,更不能代表模型的官方或普遍水平。

之前写过 Qwen3.8-27B 从 f16 到 IQ1_S 的量化阶梯,那篇说的是部署和速度。这篇只聊能力:把手头 3.6 和 3.8 两代 27B 的各种量化版、去审查版拉出来,用 BFCL V4 工具调用和六个经典基准统一测一遍,再看看本地模型替代在线 API 这事到底靠不靠谱。

先说结论:

  • 单轮工具调用,默认模板下 3.6 反而比 3.8 强。3.6 官方 Q5hyb 拿到 89.44%,是全场最高,比 3.8 最好的配置高出 2.6 分以上。
  • 两个家族都全面追平或超过 GPT-3.5。七个维度没有一个落后的,HumanEval 甚至是 100 对 48.1。
  • 去审查不是免费的。3.6 的去审查版几乎无损(-0.21),3.8 的去审查版在"该不该调用工具"的判断上直接崩到 47.92%。
  • 多轮工具调用两个都不太理想,复杂的智能体流程费劲了,当然可能主要是显存有限,上下文没给够。

一、测了什么,怎么测的

环境还是那套:llama.cpp 走 Vulkan,AMD 7900XTX 24G 主力。推理参数 --temp 0,关闭思维链,保证结果可复现。这篇不谈速度,速度的事在量化阶梯那篇里已经说过了。

受测的六个主力配置:

配置 体积 说明
3.6 官方 Q4_K_M 17.0GB 官方权重常规量化
3.6 官方 Q5hyb 19.4GB Q6/Q5 主体 + Q8_0 注意力 + Q8_0 MTP 的定制混合量化
3.6 去审查 Q5hyb 19.4GB huihui 微调 / Heretic 消融
3.8 官方 Q4_K_M 16.8GB 官方权重常规量化
3.8 官方 Q5hyb 20.6GB 同上定制混合量化
3.8 去审查 Q5hyb 19.4GB huihui 微调 / Heretic 消融

Q5hyb 是个什么东西

表格里反复出现 Q5hyb,值得单独说一下。这是我自己做的一个定制混合量化,名字就是 Q5 级混合(hybrid)的缩写。

出发点很简单:Q4_K_M 够小,但质量上总觉得还能再往上够一档;可直接上 Q6_K、Q8_0 又太大——27B 的模型,Q8_0 要 27 GiB,24G 卡物理上装不下,Q6_K 也有 20.9 GiB,塞进去之后留给 KV cache 和上下文的空间就很紧了。那就别一刀切:不同的张量对精度的敏感度本来就不一样,分开给。

设计思路一句话:好钢用在刀刃上。

  • 注意力部分保 Q8_0。注意力是整个模型里对精度最敏感的部分,Q/K/V 投影有点误差,模型"看到"的东西就变了,这块不能省。
  • MTP 层也保 Q8_0。这层体积很小,但它是投机解码的草稿层,草稿质量直接决定接受率,也就是决定提速效果。保 Q8,质量速度两头都不亏。
  • 主干 FFN 用 Q6/Q5 混合。FFN 占的参数量最大,但对精度相对宽容,往下压一档,体积省得最明显。

做法跟之前那篇里的 Q8SLIM 是同一个路子:llama-quantize 的 --tensor-type 参数可以按张量名分别指定量化类型。

出来的效果:3.8 的 Q5hyb 20.6GB,单张 24G 卡装下之后还有富余;3.6 的 Q5hyb 在这次测试里是全场总分第一的配置(BFCL 89.44%,MMLU、WinoGrande 也是第一)。

测试分两块:

一块是 BFCL V4,专门测工具调用(function calling)的,这是现在本地模型最被看重的能力之一。测了 Non-Live AST 七类、Live 真实 API、Multi-turn 多轮三部分。

另一块是六个经典基准:MMLU(知识)、HumanEval(代码)、GSM8K(数学)、HellaSwag(常识)、ARC(科学推理)、WinoGrande(语义),每个采样 30 题,题面和评分复用之前的评测框架。

GPT-3.5 的成绩全部来自公开文献:前六维取 GPT-4 Technical Report 的 Table 2(OpenAI 自己公布的),BFCL 取 ToolN1 ICLR'26 论文里 BFCL V4 2025-04-13 快照的数据。


二、BFCL V4:3.6 全面压过 3.8

2.1 Non-Live AST 总览

模型 Non-Live AST vs GPT-3.5
3.6 官方 Q5hyb 89.44% +11.4
3.6 去审查 Q5hyb 89.23% +11.2
3.6 官方 Q4_K_M 88.27% +10.3
3.8 去审查 Q5hyb 86.81% +8.8
3.8 官方 Q4_K_M 86.00% +8.0
3.8 官方 Q5hyb 85.08% +7.1

参照线:GPT-3.5-Turbo-0125 的 BFCL V4 Non-Live Overall 约 78.0%。也就是说,这六个本地量化版里最"差"的一个,也比 GPT-3.5 高 7 个点。再提醒一句:这只是我个人设备上跑出来的结果,不具有太多参考意义。

BFCL Non-Live AST(含 GPT-3.5 参照线)

2.2 拆开看:输在哪,赢在哪

总分只是一个数,拆开按类别看才有意思:

类别 3.6 家族 3.8 家族 谁赢
simple_python 95.75~96.25 96.25~97.0 3.8 略胜
simple_java 63~65 65~66 半斤八两
simple_javascript 74~76 70~78 半斤八两
multiple(多函数选一) 94.0~95.0 96.5 3.8
parallel(并行调用) 90.5~92.0 81.0~90.5 3.6
parallel_multiple 91.0~92.5 79.0~84.0 3.6 明显
irrelevance(识别无可用函数) 90.0(全员) 70.4~76.7 3.6 明显

规律很清楚:单次调用、从一堆函数里挑一个这种"简单活",3.8 做得稍好;一旦要一次并行调多个函数,或者要判断"这个请求根本没有合适的函数、应该拒绝调用",3.6 的优势就出来了,parallel_multiple 上差了将近 10 个点。

irrelevance 这一项值得单独说。它测的是模型会不会"没活硬干"——给一个和所有函数都不沾边的请求,看模型是老实说没有合适工具,还是硬编一个调用出来。3.6 所有版本都稳在 90%,3.8 官方版本只有 70 出头。这个能力在真实 agent 场景里很要命:工具列表一大,模型要是见什么都想调,整个流程就会被幻觉调用带偏。

2.3 Live 与 Multi-turn

Live(真实 API 子集)只有 Q4 系列跑了完整数据:

模型 Live Overall
3.6 官方 Q4_K_M 82.16%
3.8 Q4_K_REC v22 82.16%
3.8 官方 Q4_K_M 81.72%
3.8 Q4_K_REC 80.98%

Live 上两家基本打平,差不到半个点。顺带一提,3.8 还有两个 Q4_K_REC 变体配置也跑了,成绩都在 80.98~82.16 这个区间里,和官方 Q4_K_M 没有本质区别。

Multi-turn 就没什么好说的了,全员拉胯:

模型 Multi-turn Overall Base 子项
3.6 官方 Q4_K_M 18.50% 74.0%
3.8 官方 Q4_K_M 17.25% 69.0%
3.8 Q4_K_REC 16.25% 65.0%

多轮工具调用要求模型在状态不断变化、函数缺失、参数缺失的情况下持续做正确决策,18% 这种成绩说明两代模型离"可靠的 agent 大脑"都还有距离。这点后面讨论替代在线模型时还要提。


三、七维能力雷达 vs GPT-3.5

六个基准加 BFCL,凑七个维度:

模型 MMLU HumanEval GSM8K HellaSwag ARC WinoGrande BFCL
3.6 官方 Q4_K_M 70.0 100.0 100.0 86.7 93.3 83.3 88.3
3.6 官方 Q5hyb 73.3 100.0 100.0 90.0 93.3 86.7 89.4
3.6 去审查 Q5hyb 70.0 100.0 100.0 93.3 93.3 80.0 89.2
3.8 官方 Q4_K_M 66.7 100.0 96.7 93.3 100.0 83.3 86.0
3.8 官方 Q5hyb 70.0 100.0 96.7 90.0 100.0 83.3 85.1
3.8 去审查 Q5hyb 66.7 100.0 93.3 86.7 100.0 83.3 86.8
GPT-3.5-Turbo 70.0 48.1 57.1 85.5 85.2 81.6 78.0

3.6 vs 3.8 七维能力雷达(含 GPT-3.5 参照)

几个要点:

全部六个量化版在七个维度上没有一个低于 GPT-3.5 的。差距最大的是 HumanEval,100 对 48.1——当然这里要说明,30 题的 HumanEval 子集全对,和官方 164 题全量不是一回事,但起码说明代码生成这块,本地 27B 量化版完全不虚三年前的 GPT-3.5。GSM8K 同理,93.3~100 对 57.1。

最接近的是 MMLU,66.7~73.3 对 70.0,基本持平。知识面这种东西跟参数规模和训练数据强相关,追平就是追平,没什么可吹的,也没输。

3.6 官方 Q5hyb 是全场唯一在多数维度领先的配置,MMLU、WinoGrande、BFCL 三项第一。3.8 家族则在 ARC 上全员满分。

由于时间有限,所以每维只有 30 题,统计方差大约 ±9%,维度之间 5 分以内的差异不具备显著性。HumanEval 和 GSM8K 又都摸到了满分天花板,区分度为零。所以这张雷达图能说明"追平并超过 GPT-3.5"这个定性结论,但应该是不能拿小数点做严格比较。而且这一切都只是在我个人的设备上、用我这套环境跑出来的,换个环境未必是这个样子,参考意义有限。


四、3.6 对 3.8:同门对决

把两代模型的差异单独拎出来:

3.6 赢的地方:

  • BFCL Non-Live 总分,89.44 对 85.08~86.81,全场前三被 3.6 家族包揽。
  • 并行调用(parallel、parallel_multiple),这是真实工作流里最常见的模式。
  • irrelevance 检测,90 对 70 出头,质的差距。
  • WinoGrande 和 MMLU(Q5hyb 配置下)。

3.8 赢的地方:

  • multiple 单选,96.5 对 94~95。
  • simple_python / simple_java 单函数调用,略高。
  • ARC 满分对 93.3。

量化敏感度的方向也不一样:3.6 是 Q5hyb 比 Q4_K_M 好(89.44 对 88.27),3.8 反而 Q4_K_M 比 Q5hyb 略好(86.00 对 85.08)。这个反向差异在 ±9% 的样本方差里未必站得住,但至少说明两代模型对量化方式的响应不一样,不能拿着一代的经验直接套另一代。

总的判断:这次测试用的是默认模板。在默认模板下,如果你的主要用途是工具调用、agent 类任务,3.6 有时候的表现反而比最新的 3.8 要好,而且不是险胜;3.8 的优势集中在单函数调用和科学推理这种单点能力上。所以别迷信版本号,不是最新的模型在所有场景下都比旧模型强——这代 3.8 在 BFCL 上就是实打实的退步。当然,这也只是我个人设备上的结果,仅供参考。


五、去审查的代价:两家完全不一样

去审查(去对齐)版本是本地社区的特色需求。这次测的两个去审查版,走的是 huihui 微调和 Heretic 消融的路子。结果非常有意思:

3.6 去审查版:BFCL 89.23,比官方版 89.44 只低 0.21,irrelevance 检测保持 90%,七个基准维度的波动全在方差范围内。可以说能力基本无损。

3.8 去审查版:BFCL 总分 86.81,看着甚至比官方 Q5hyb 的 85.08 还高一点,但拆开看就露馅了——irrelevance 检测从 70 多直接掉到 47.92%,腰斩都不止。也就是说,去审查之后的 3.8 变得"特别乐于助人":不管请求跟工具沾不沾边,都倾向于调用一个函数试试。multiple、parallel 这些类别它甚至还略有提升,但"该拒绝时拒绝"的能力基本丢了。

这个对比说明一件事:去审查对能力的影响不是个固定的"损耗百分比",它取决于对齐微调动的是哪块。3.6 的去对齐做得干净,3.8 的去对齐把工具调用的边界感也一起消融掉了。选去审查版本之前,最好先想清楚自己要的是什么——如果是拿来跑 agent,一个不会拒绝的模型可能比一个偶尔拒绝的模型更危险。


六、本地模型能不能替代在线模型

这是绕不开的问题。先限定讨论范围:这里的"在线模型"参照是 GPT-3.5-Turbo,也就是 2023 年初的水平,很多 API 场景至今还在用的那个档次。

从这次的数据看,替代是成立的:

七个能力维度全部追平或超过,工具调用超出 7~11 个点。对于"调 API 做单轮任务"这类需求——翻译、抽取、格式转换、单函数工具调用——本地 27B 量化版给出的质量不低于 GPT-3.5 档次的在线服务,而且数据不出本地、零调用成本、断网也能跑。数据敏感的场景里,这本身就是决定性的优势。

但有三条边界要说清楚:

第一,GPT-3.5 是个三年前的靶子。赢了它也远不能比现在的旗舰在线模型,都不用说那些闭源的,就连开源的GLM5.3、DeepSeek V4 等等更大规模参数的开源在线模型的推理和长文本能力,本地这种 27B 的小模型也还差得远。

第二,多轮是硬伤。Multi-turn 18% 的成绩意味着"模型自己规划、连续多轮调工具、处理异常"这种复杂 agent 流程,我这台设备上用当前的参数恐怕目前撑不起来。这类任务要么继续用在线旗舰模型,要么自己在框架层做大量兜底。

第三,样本量的限制。30 题的基准只能给出定性结论,真要下"全面替代"的判断,得上全量测试。这篇的结论是"能力上够格",不是"统计上严格证明"。

第四,也是最根本的一条:以上所有数字都只是在我个人的设备上跑出来的,不具有太多参考意义。替代成立与否,最终要在你自己的环境里验证。

不过,总体来看,本地模型好歹也达到替代 GPT-3.5 的能力了。


七、总结一下

  • 工具调用选 3.6,官方 Q5hyb 是全场最佳配置,89.44%。
  • 3.8 在单函数调用和 ARC 上有优势,但 BFCL 总分对 3.6 是退步。
  • 对 GPT-3.5:七维全胜或持平,本地替代在单轮任务上成立。
  • 去审查:3.6 几乎无损,3.8 的 irrelevance 检测崩到 47.92%,选之前想清楚。

最后再强调一遍:以上所有数据都只是在我个人的设备上跑出来的结果,不具有太多参考意义,看个思路就好。