7900XTX 本地模型大阅兵:开源小/中/大三档,能否追上 GPT-3.5 与 GPT-4o?
单张 7900XTX 24GB 上实测 22 个开源模型,对标 GPT-3.5 与 GPT-4o。发现开源已追平 2024 闭源第一梯队;工具调用主力首选 Qwen 3.6 27B Q5Hyb,六维 90.5、BFCL 89.4 全场第一,综合来看甚至强于 Qwen 3.8 27B;性价比选 Gemma4 E4B,极致速度选 Nemotron。
之前我们曾把本地模型和 GPT-3.5 做过对比。现在回头看,除了 GPT-3.5,第二年的 GPT-4o 同样值得参照——一个代表"能用"的门槛,一个代表 2024 年第一梯队的标杆。这次的雷达图同时画上这两条基线。
模型有大有小。这次在单张 7900XTX 24GB 上,选了一批当前有代表性的模型——硬盘空间有限,不可能全装,只选不算太旧、各尺寸段有代表性的:小尺寸(≤1.2GB)、中尺寸(1.2-8GB)、大尺寸(>8GB,需 8G+ 显存)三档。核心问题只有一个:现在的开源模型,和当年的闭源模型相比,到底怎么样了?
所有模型均在同一张 7900XTX 上实测(六维基准各 30 题 + 单流生成速度 + 官方 BFCL 工具调用);闭源基线取公开可查证分数(出处逐项标注,见下表)。
所谓"六维",指下表参照基线里列出的六个基准,覆盖知识、代码、数学、常识推理四类能力,每维 30 题、"六维均分"即六项准确率的算术平均:
- MMLU:多任务语言理解(专业/通识知识选择题);
- HumanEval:代码生成(函数补全,pass@1);
- GSM8K:小学数学应用题(多步推理);
- HellaSwag:常识句子补全(反直觉干扰项);
- ARC:科学/常识问答;
- WinoGrande:指代消解(代词指向)。
工具调用方面:BFCL(Berkeley Function Calling Leaderboard)就是标准的工具调用评测,本次 22 个模型全部跑完 V4 Non-Live 七类 AST(见各档表格与专项表);ToolBench 是另一个更重的 agent 型工具调用基准(多步规划),仅 27B 家族六个模型有实测,主要体现出 27B 的 3.6 还是比 3.8 更好的选择。
参照基线:GPT-3.5 与 GPT-4o
| 维度 | GPT-3.5-Turbo (2023) | GPT-4o (2024) | 出处 |
|---|---|---|---|
| MMLU | 70.0 | 88.7 | GPT-4 Technical Report (arXiv:2303.08774) / OpenAI 官方 |
| HumanEval 编程 | 48.1 | 90.2 | 同上 / OpenAI 官方(System Card + Azure AI 目录) |
| GSM8K | 57.1 | 96.0* | 同上 / *官方未发布,社区实测中位 |
| HellaSwag | 85.5 | 95.3* | 同上 / *llm-stats 社区实测 |
| ARC | 85.2 | 95.5* | 同上 / *llm-stats 社区实测 |
| WinoGrande | 81.6 | 88.5* | 同上 / *llm-stats 社区实测 |
| BFCL 工具调用(单轮 AST) | 84.5 | 85.9 / 87.4 | BFCL v3 官方榜单:GPT-3.5-Turbo-0125 (FC) AST 84.52(ToolACE 论文 arXiv:2409.00920 引 2024-09-20 榜单);GPT-4o-2024-08-06 AST 85.9(Amazon Nova 报告 arXiv:2506.12103 引 2024-11-17 榜单)、gpt-4o-2024-11-20 (FC) Non-Live AST 87.42(官方榜 2025-01-18 快照) |
| BFCL Overall(含多轮) | 51.93(多轮仅 19.12) | 68.9 / 69.6(多轮 63.4) | 同上 |
| 生成速度 | ~65 t/s (API) | ~92 t/s (API) | Artificial Analysis / llm-stats 实测中位 |
说明:①本地模型 BFCL 为 V4 七类 AST 平均,闭源为 v3 榜单口径,测试集版本不同,对比仅供参考;②GPT-3.5 的 BFCL Overall 只有 51.93,主因是多轮(19.12)拉胯——单轮工具调用它并不弱(84.5);③带 * 维度为官方未发布、取社区实测中位;④HumanEval 均为官方 0-shot/pass@1 口径。
一、小尺寸档(≤1.2GB)——秒开级轻骑兵
| 排名 | 型号 | 家族 | 参数量 | 量化 | 文件大小 | 代码 HumanEval | 工具调用 BFCL | 六维均分 | 生成 t/s |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3 0.6B | Alibaba Qwen3 | 0.75B | Q4_K_M | 0.52GB | 53.3 | 65.5 | 47.2 | 250.9 |
| 2 | Qwen3.5 0.8B | Alibaba Qwen3.5 | 0.87B | Q8_0 | 1.0GB | 33.3 | 57.8 | 42.8 | 185.4 |
| 3 | Granite4 0.35B | IBM Granite 4.0 | 0.34B | Q8_0 | 0.37GB | 66.7 | 67.0 | 40.0 | 258.2 |
| 4 | LFM2.5-Think 1.2B | LiquidAI LFM2.5 | 1.2B | Q4_K_M | 0.73GB | 30.0 | 72.3 | 28.3 | 355.9 |
| 5 | LFM2.5 0.35B | LiquidAI LFM2.5 | 0.35B | Q8_0 | 0.38GB | 3.3 | 45.9 | 24.4 | 374.4 |
特点:Qwen3 0.6B 微型全能底子;Qwen3.5 0.8B 新一代微型、数学强;Granite4 0.35B 企业级安全调优、MoE 混合架构;LFM2.5-Think 1.2B 思考型、小身材长推理;LFM2.5 0.35B 非Transformer混合架构。

这一档 5 个模型全部在 1.2GB 以内,加载秒开、生成速度 185-374 t/s 是全部参赛选手里最快的。共同短板也很明显:六维平均分只有 24-47,MMLU/数学都远远够不着 GPT-3.5 的边。它们的正确用法是高频轻任务:文本翻译(短句翻译几乎瞬时返回,日常中英互译质量够用、速度是大模型的 3-5 倍)、分类、摘要、格式转换、意图路由——以及给大模型当"前置路由",判断该不该升级到大模型处理。代码能力分化明显:Granite4 0.35B 的 HumanEval 66.7 是本档意外亮点,Qwen3 0.6B 53.3 次之,LFM2.5 两兄弟(3-30 分)基本不会写代码。工具调用:本档 BFCL 实测 LFM2.5 0.35B 45.9、Granite4 0.35B 67.0、LFM2.5-Think 1.2B 72.3、Qwen3 0.6B 65.5、Qwen3.5 0.8B 57.8——远低于大模型档(77-89),简单单工具调用勉强可用(Granite 0.35B 的 multiple 85 出人意料),但平行调用和复杂 agent 别指望。
➡️ 本档推荐:Qwen3 0.6B(六维 47.2 分 + 250.9 t/s;本档首选翻译/摘要/路由等轻任务)
二、中尺寸档(1.2-8GB)——单卡实用主力
| 排名 | 型号 | 家族 | 参数量 | 量化 | 文件大小 | 代码 HumanEval | 工具调用 BFCL | 六维均分 | 生成 t/s |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Gemma4 E4B | Google Gemma4 | 4B 有效(总7.5B) | Q4_K_M | 5.0GB | 100.0 | 81.9 | 83.4 | 115.0 |
| 2 | Gemma4 12B | Google Gemma4 | 11.9B | Q4_K_M | 7.1GB | 83.3 | 77.6 | 80.6 | 62.4 |
| 3 | Qwen3.5 9B | Alibaba Qwen3.5 | 9.7B | Q4_K_M | 6.6GB | 73.3 | 80.9 | 80.5 | 79.3 |
| 4 | Gemma4 E2B | Google Gemma4 | 2B 有效(总4.6B) | Q4_K_M | 3.1GB | 100.0 | 79.7 | 75.0 | 154.9 |
| 5 | OmniCoder2 9B | 社区 OmniCoder | 9.0B | Q4_K_M | 5.7GB | 93.3 | 81.3 | 48.3 | 85.1 |
特点:Gemma4 E4B 性价比之王;Gemma4 12B 中量级标杆;Qwen3.5 9B 中坚全能;Gemma4 E2B 轻任务够用;OmniCoder2 9B 代码特化、通用偏科。

这一档开始进入"真正能用"的区间:五个模型六维平均分 48-83,Gemma4 E4B 以 4B 参数拿到 83.4 分 + 115 t/s,超过 GPT-3.5 六维平均(71.2),是全场性价比最高的一档。代码能力全员过关:Gemma4 E2B/E4B 的 HumanEval 双双 100 分,OmniCoder2 93.3(不愧代码特化),Gemma4 12B 83.3 / Qwen3.5 9B 73.3 稳定。E2B(75 分)证明了 2B 就是日常轻聊天+轻代码的底线;Qwen3.5 9B 和 Gemma4 12B 是均衡中坚;OmniCoder 偏科严重(只会写代码,通用垫底 48.3)。工具调用:本档 5/5 模型完成 BFCL 实测(见上表),Qwen3.5/Gemma4 家族模板层均已验证支持 function calling。单卡日常主力建议从这档选——除非你确定需要旗舰级能力。
➡️ 本档推荐:Gemma4 E4B(六维 83.4 分 + HumanEval 100 + 115 t/s,性价比之王;工具调用已实测 BFCL 81.9,需要 function calling 的场景本档即可胜任)
三、大尺寸档(>8GB,需 8G+ 显存)——旗舰竞技场
| 排名 | 型号 | 家族 | 参数量 | 量化 | 文件大小 | 代码 HumanEval | 工具调用 BFCL | 六维均分 | 生成 t/s |
|---|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3.6 35B MoE | Alibaba Qwen3.6 | 34.7B(A3B) | Q4_K_M | 22.0GB | 96.7 | 83.0 | 93.4 | 106.7 |
| 2 | Gemma4 31B | Google Gemma4 | 30.7B 稠密 | Q4_K_M | 18.0GB | 100.0 | 83.6 | 91.7 | 29.3 |
| 3 | Nemotron 3.5 Lightning | NVIDIA | 30B(A3B) | Q4_0 | 18.9GB | 100.0 | 79.7 | 91.1 | 129.0 |
| 4 | Qwen 3.6 27B Q5Hyb | Alibaba Qwen3.6 | 27B 稠密 | Q5Hyb | 20.6GB | 100.0 | 89.4 | 90.5 | 29.91 |
| 5 | Qwen 3.8 27B Q4_K_M | Alibaba Qwen3.8 | 27B 稠密 | Q4_K_M | 16.8GB | 100.0 | 86.0 | 90.0 | 37.94 |
| 6 | Qwen 3.8 27B Q5Hyb | Alibaba Qwen3.8 | 27B 稠密 | Q5Hyb | 20.6GB | 100.0 | 85.1 | 90.0 | 30.22 |
| 7 | Huihui 3.6 27B Q5Hyb | Huihui 去审查 | 27B 稠密 | Q5Hyb | 20.6GB | 100.0 | 89.2 | 89.4 | 30.73 |
| 8 | Qwen 3.6 27B Q4_K_M | Alibaba Qwen3.6 | 27B 稠密 | Q4_K_M | 17.0GB | 100.0 | 88.3 | 88.9 | 36.32 |
| 9 | Uncensored 3.8 27B Q5Hyb | Heretic 去审查 | 27B 稠密 | Q5Hyb | 20.6GB | 100.0 | 86.8 | 88.3 | 30.72 |
| 10 | GLM4.7 Flash | 智谱 GLM | 29.9B MoE | Q4_K_M | 18.0GB | 100.0 | 79.4 | 88.3 | 95.5 |
| 11 | Gemma4 26B MoE | Google Gemma4 | 25.2B(A4B) | Q4_K_M | 16.0GB | 100.0 | 78.3 | 87.2 | 91.1 |
| 12 | GPT-OSS 20B | OpenAI gpt-oss | 20.9B(A3.6B) | Q4_K_M | 11.0GB | 86.7 | 52.9 | 78.9 | 155.0 |
特点:Qwen3.6 35B MoE 全场总分第一;Gemma4 31B 大杯旗舰、速度慢;Nemotron 3.5 Lightning Mamba2+MoE、agent 执行层;Qwen 3.6 27B Q5Hyb 定制混合量化(Q5主体+Q8注意力);Qwen 3.8 27B Q4_K_M 混合线性注意力架构;Qwen 3.8 27B Q5Hyb 定制混合量化;Huihui 3.6 27B Q5Hyb abliterated 去对齐;Qwen 3.6 27B Q4_K_M 官方标准量化;Uncensored 3.8 27B Q5Hyb 消融法去对齐;GLM4.7 Flash 国产旗舰 MoE 轻量版;Gemma4 26B MoE MoE 高效大杯;GPT-OSS 20B OpenAI 开源 MoE。

12 个模型挤在这一档,也是和 GPT-4o 正面交锋的主战场。Qwen3.6 35B MoE 以 93.4 分 + 106.7 t/s 双料登顶,但是工具调用不如 27B 家族的,好在六维全面越过 GPT-4o 基线(89.5);Gemma4 31B(91.7 分)是稠密阵营最强但速度只有 29 t/s;Nemotron 3.5 Lightning(91.1 分 + 129 t/s)靠 Mamba2+MoE 架构拿到全场最快大模型;Qwen 27B 家族六个模型挤在 88.9-90.5 的密集区间——量化选择的影响(约 1 分)远小于家族差异。这一档全员在能力面上越过或贴住 GPT-4o,仅在速度轴被本地小模型反超。
本档工具调用专项实测——BFCL(V4 Non-Live AST 七类官方口径)12 个模型全部实测:
| 型号 | BFCL 工具调用 |
|---|---|
| Qwen3.6 35B MoE | 83.0 |
| Gemma4 31B | 83.6 |
| Nemotron 3.5 Lightning | 79.7 |
| Qwen 3.6 27B Q5Hyb | 89.4 |
| Qwen 3.8 27B Q4_K_M | 86.0 |
| Qwen 3.8 27B Q5Hyb | 85.1 |
| Huihui 3.6 27B Q5Hyb | 89.2 |
| Qwen 3.6 27B Q4_K_M | 88.3 |
| Uncensored 3.8 27B Q5Hyb | 86.8 |
| GLM4.7 Flash | 79.4 |
| Gemma4 26B MoE | 78.3 |
| GPT-OSS 20B | 52.9 |
BFCL 七类中 simple_python 全员 93-97;Java/JS 是所有模型的洼地(60-78);3.8 家族 irrelevance(该拒判时不调用)明显弱于 3.6(70-75 vs 90),去审查版 Uncensored 更低至 47.9。
ToolBench-Static 专项实测(100 域内+50 域外抽样;仅 27B 家族六兄弟有实测,其余大模型未跑):
| 型号 | ToolBench 域内 plan_em | 域外 plan_em |
|---|---|---|
| Qwen 3.6 27B Q5Hyb | 0.822 | 0.837 |
| Qwen 3.8 27B Q4_K_M | 0.822 | 0.857 |
| Qwen 3.8 27B Q5Hyb | 0.835 | 0.816 |
| Huihui 3.6 27B Q5Hyb | 0.800 | 0.816 |
| Qwen 3.6 27B Q4_K_M | 0.789 | 0.816 |
| Uncensored 3.8 27B Q5Hyb | 0.833 | 0.857 |
➡️ 本档推荐:综合主力首选 Qwen 3.6 27B(Q5Hyb)——27B 量级能力均衡无短板,工具调用非常强(BFCL 89.4 全场第一、ToolBench 域内 0.822、六维 90.5 领先 27B 家族);且 3.8 在 27B 档并没有比 3.6 强太多(六维 90.0 vs 90.5 持平,工具调用反而落后 3-4 分),换代收益有限。要极致总分再上 Qwen3.6 35B MoE(六维 93.4 分,工具调用 实测 83.0);要速度选 Nemotron(129 t/s,BFCL 79.7,Java/JS 偏弱)。
四、全景:22 模型同场雷达

| 排名 | 型号 | 参数量 | 文件大小 | 代码 HumanEval | 工具调用 BFCL | 六维平均分 | 生成 t/s |
|---|---|---|---|---|---|---|---|
| 1 | Qwen3.6 35B MoE | 34.7B(A3B) | 22.0GB | 96.7 | 83.0 | 93.4 | 106.7 |
| 2 | Gemma4 31B | 30.7B 稠密 | 18.0GB | 100.0 | 83.6 | 91.7 | 29.3 |
| 3 | Nemotron 3.5 Lightning | 30B(A3B) | 18.9GB | 100.0 | 79.7 | 91.1 | 129.0 |
| 4 | Qwen 3.6 27B Q5Hyb | 27B 稠密 | 20.6GB | 100.0 | 89.4 | 90.5 | 29.91 |
| 5 | Qwen 3.8 27B Q4_K_M | 27B 稠密 | 16.8GB | 100.0 | 86.0 | 90.0 | 37.94 |
| 6 | Qwen 3.8 27B Q5Hyb | 27B 稠密 | 20.6GB | 100.0 | 85.1 | 90.0 | 30.22 |
| 7 | Huihui 3.6 27B Q5Hyb | 27B 稠密 | 20.6GB | 100.0 | 89.2 | 89.4 | 30.73 |
| 8 | Qwen 3.6 27B Q4_K_M | 27B 稠密 | 17.0GB | 100.0 | 88.3 | 88.9 | 36.32 |
| 9 | Uncensored 3.8 27B Q5Hyb | 27B 稠密 | 20.6GB | 100.0 | 86.8 | 88.3 | 30.72 |
| 10 | GLM4.7 Flash | 29.9B MoE | 18.0GB | 100.0 | 79.4 | 88.3 | 95.5 |
| 11 | Gemma4 26B MoE | 25.2B(A4B) | 16.0GB | 100.0 | 78.3 | 87.2 | 91.1 |
| 12 | Gemma4 E4B | 4B 有效(总7.5B) | 5.0GB | 100.0 | 81.9 | 83.4 | 115.0 |
| 13 | Gemma4 12B | 11.9B | 7.1GB | 83.3 | 77.6 | 80.6 | 62.4 |
| 14 | Qwen3.5 9B | 9.7B | 6.6GB | 73.3 | 80.9 | 80.5 | 79.3 |
| 15 | GPT-OSS 20B | 20.9B(A3.6B) | 11.0GB | 86.7 | 52.9 | 78.9 | 155.0 |
| 16 | Gemma4 E2B | 2B 有效(总4.6B) | 3.1GB | 100.0 | 79.7 | 75.0 | 154.9 |
| 17 | OmniCoder2 9B | 9.0B | 5.7GB | 93.3 | 81.3 | 48.3 | 85.1 |
| 18 | Qwen3 0.6B | 0.75B | 0.52GB | 53.3 | 65.5 | 47.2 | 250.9 |
| 19 | Qwen3.5 0.8B | 0.87B | 1.0GB | 33.3 | 57.8 | 42.8 | 185.4 |
| 20 | Granite4 0.35B | 0.34B | 0.37GB | 66.7 | 67.0 | 40.0 | 258.2 |
| 21 | LFM2.5-Think 1.2B | 1.2B | 0.73GB | 30.0 | 72.3 | 28.3 | 355.9 |
| 22 | LFM2.5 0.35B | 0.35B | 0.38GB | 3.3 | 45.9 | 24.4 | 374.4 |
速度为单流实测(27B 取无 MTP 基线);六维=30题/维;GPT-3.5 基线六维平均 71.2,GPT-4o 约 89.2。颜色=家族,线型=家族内成员;黑色加粗虚线=GPT-3.5,灰色点划线=GPT-4o。
4.1 详细分数全表(22 模型六维明细 + BFCL 汇总)
六维明细(MMLU / HumanEval / GSM8K / HellaSwag / ARC / WinoGrande,各 30 题 acc;按文件大小升序):
| 型号 | 文件GB | MMLU | HumanEval | GSM8K | HellaSwag | ARC | WinoGrande | 六维均分 |
|---|---|---|---|---|---|---|---|---|
| Granite4 0.35B | 0.37 | 40.0 | 66.7 | 23.3 | 33.3 | 26.7 | 50.0 | 40.0 |
| LFM2.5 0.35B | 0.38 | 26.7 | 3.3 | 6.7 | 23.3 | 46.7 | 40.0 | 24.4 |
| Qwen3 0.6B | 0.52 | 36.7 | 53.3 | 66.7 | 20.0 | 56.7 | 50.0 | 47.2 |
| LFM2.5-Think 1.2B | 0.73 | 23.3 | 30.0 | 46.7 | 20.0 | 13.3 | 36.7 | 28.3 |
| Qwen3.5 0.8B | 1.0 | 13.3 | 33.3 | 73.3 | 40.0 | 50.0 | 46.7 | 42.8 |
| Gemma4 E2B | 3.1 | 66.7 | 100.0 | 96.7 | 33.3 | 80.0 | 73.3 | 75.0 |
| Gemma4 E4B | 5.0 | 70.0 | 100.0 | 86.7 | 66.7 | 90.0 | 86.7 | 83.4 |
| OmniCoder2 9B | 5.7 | 13.3 | 93.3 | 80.0 | 23.3 | 30.0 | 50.0 | 48.3 |
| Qwen3.5 9B | 6.6 | 66.7 | 73.3 | 90.0 | 80.0 | 90.0 | 83.3 | 80.5 |
| Gemma4 12B | 7.1 | 70.0 | 83.3 | 66.7 | 80.0 | 96.7 | 86.7 | 80.6 |
| GPT-OSS 20B | 11.0 | 63.3 | 86.7 | 90.0 | 63.3 | 93.3 | 76.7 | 78.9 |
| Gemma4 26B MoE | 16.0 | 66.7 | 100.0 | 76.7 | 90.0 | 96.7 | 93.3 | 87.2 |
| Qwen 3.8 27B Q4_K_M | 16.8 | 66.7 | 100.0 | 96.7 | 93.3 | 100.0 | 83.3 | 90.0 |
| Qwen 3.6 27B Q4_K_M | 17.0 | 70.0 | 100.0 | 100.0 | 86.7 | 93.3 | 83.3 | 88.9 |
| GLM4.7 Flash | 18.0 | 73.3 | 100.0 | 93.3 | 80.0 | 93.3 | 90.0 | 88.3 |
| Gemma4 31B | 18.0 | 86.7 | 100.0 | 76.7 | 93.3 | 100.0 | 93.3 | 91.7 |
| Nemotron 3.5 Lightning | 18.9 | 90.0 | 100.0 | 90.0 | 76.7 | 93.3 | 96.7 | 91.1 |
| Huihui 3.6 27B Q5Hyb | 20.6 | 70.0 | 100.0 | 100.0 | 93.3 | 93.3 | 80.0 | 89.4 |
| Qwen 3.6 27B Q5Hyb | 20.6 | 73.3 | 100.0 | 100.0 | 90.0 | 93.3 | 86.7 | 90.5 |
| Qwen 3.8 27B Q5Hyb | 20.6 | 70.0 | 100.0 | 96.7 | 90.0 | 100.0 | 83.3 | 90.0 |
| Uncensored 3.8 27B Q5Hyb | 20.6 | 66.7 | 100.0 | 93.3 | 86.7 | 100.0 | 83.3 | 88.3 |
| Qwen3.6 35B MoE | 22.0 | 96.7 | 96.7 | 86.7 | 93.3 | 100.0 | 86.7 | 93.4 |
BFCL 工具调用汇总(27B 家族为官方 Non-Live Overall Acc,其余为 V4 七类 AST 平均):
| 型号 | 文件GB | BFCL 工具调用 |
|---|---|---|
| Granite4 0.35B | 0.37 | 67.0 |
| LFM2.5 0.35B | 0.38 | 45.9 |
| Qwen3 0.6B | 0.52 | 65.5 |
| LFM2.5-Think 1.2B | 0.73 | 72.3 |
| Qwen3.5 0.8B | 1.0 | 57.8 |
| Gemma4 E2B | 3.1 | 79.7 |
| Gemma4 E4B | 5.0 | 81.9 |
| OmniCoder2 9B | 5.7 | 81.3 |
| Qwen3.5 9B | 6.6 | 80.9 |
| Gemma4 12B | 7.1 | 77.6 |
| GPT-OSS 20B | 11.0 | 52.9 |
| Gemma4 26B MoE | 16.0 | 78.3 |
| Qwen 3.8 27B Q4_K_M | 16.8 | 86.0 |
| Qwen 3.6 27B Q4_K_M | 17.0 | 88.3 |
| GLM4.7 Flash | 18.0 | 79.4 |
| Gemma4 31B | 18.0 | 83.6 |
| Nemotron 3.5 Lightning | 18.9 | 79.7 |
| Huihui 3.6 27B Q5Hyb | 20.6 | 89.2 |
| Qwen 3.6 27B Q5Hyb | 20.6 | 89.4 |
| Qwen 3.8 27B Q5Hyb | 20.6 | 85.1 |
| Uncensored 3.8 27B Q5Hyb | 20.6 | 86.8 |
| Qwen3.6 35B MoE | 22.0 | 83.0 |
4.2 27B 家族深挖数据对比(拒答率 / τ² / MTP / ToolBench 幻觉率 / BFCL irrelevance)
结论里提到的拒答率、irrelevance 拒判、MTP 加速、τ² 智能体等,原始实测数据如下(27B 家族六个模型;τ² 为本地 user-sim 口径、非官方协议;拒答率越低越不拘束):
| 型号 | 拒答率 | τ² 成功率 | MTP n=3 t/s | MTP 加速比 | 无MTP t/s | ToolBench 幻觉率(域内/域外) | BFCL irrelevance |
|---|---|---|---|---|---|---|---|
| Qwen 3.8 27B Q4_K_M | 0.05 | 100% | 66.4 | 1.75x | 37.9 | 0.03 / 0.04 | 74.6 |
| Qwen 3.6 27B Q4_K_M | 0.15 | 93% | 60.2 | 1.66x | 36.3 | 0.03 / 0.02 | 90.0 |
| Qwen 3.6 27B Q5Hyb | 0.15 | 93% | 55.1 | 1.84x | 29.9 | 0.05 / 0.04 | 90.0 |
| Qwen 3.8 27B Q5Hyb | 0.05 | 100% | 59.7 | 1.98x | 30.2 | 0.00 / 0.00 | 70.4 |
| Huihui 3.6 27B Q5Hyb | 0.00 | 93% | 65.2 | 2.12x | 30.7 | 0.02 / 0.02 | 90.0 |
| Uncensored 3.8 27B Q5Hyb | 0.05 | 93% | 59.4 | 1.94x | 30.7 | 0.00 / 0.00 | 47.9 |
读法:拒答率 huihui 全量微调去对齐最彻底(0.0),官方版 0.05-0.15;τ² 成功率 3.8 家族两兄弟 100%、其余 93%;MTP 加速 全部 1.66-2.12x;幻觉率 3.8 家族(0.00-0.04)普遍低于 3.6(0.02-0.05);irrelevance 拒判 3.6 家族 90 明显强于 3.8(70-75),去审查版 Uncensored 掉到 47.9——这正是结论 3 判断"3.6 工具调用更强"的原始依据。
五、结论
-
开源已追平 2024 闭源第一梯队:大尺寸档冠军 Qwen3.6 35B MoE(93.4 分)全面越过 GPT-4o 基线,前十名大模型全部在能力面上贴住或超过 GPT-4o。
-
MoE 是当前甜点架构:总榜前十中 MoE 占四席(Qwen3.6 35B、Nemotron、GPT-OSS、Gemma4 26B),且速度普遍 90-130 t/s,比同档稠密模型快 3-4 倍。
-
工具调用的主力推荐:Qwen 3.6 27B(首选 Q5Hyb,其次官方 Q4_K_M)——27B 这个量级能力均衡没有短板:六维 88.9-90.5、BFCL 工具调用 88.3-89.4(27B 档全员 85+,非常强)、ToolBench 域内 0.79-0.82、拒答率克制(官方 0.15)、还有 MTP 1.7-2.1x 加速可用。更关键的判断是:在 27B 档,Qwen 3.8 并没有比 3.6 强太多——六维 90.0 vs 90.5、MMLU 70.0 vs 73.3 基本持平,而 3.6 在最要紧的工具调用上明显领先(BFCL 88.3-89.4 vs 85.1-86.8,irrelevance 拒判 90 vs 70-75),甚至超过 GPT-4o 的单轮工具调用(87.4,v3 榜口径,版本不同仅供参考)。换代收益有限,选能力更全面、工具调用更强的 3.6,才是单卡日常主力的正解。
-
按量级选型:轻任务/翻译/路由 Qwen3 0.6B(250 t/s);中量级性价比 Gemma4 E4B(83 分+115 t/s);旗舰总分 Qwen3.6 35B MoE(93.4 分);均衡主力 Qwen 3.6 Q5Hyb(见结论 3);要极致速度的大模型选 Nemotron(129 t/s)。
-
速度与能力要做好取舍:大尺寸 MoE 已经同时给出 90+ 分和 100+ t/s,真正的取舍只存在于"极致速度(小模型 250 t/s+)"和"极致能力(93+ 分)"之间。