7900XTX 本地模型大阅兵:开源小/中大三档,能否追上 GPT-3.5 与 GPT-4o?

7900XTX 本地模型大阅兵:开源小/中/大三档,能否追上 GPT-3.5 与 GPT-4o?

单张 7900XTX 24GB 上实测 22 个开源模型,对标 GPT-3.5 与 GPT-4o。发现开源已追平 2024 闭源第一梯队;工具调用主力首选 Qwen 3.6 27B Q5Hyb,六维 90.5、BFCL 89.4 全场第一,综合来看甚至强于 Qwen 3.8 27B;性价比选 Gemma4 E4B,极致速度选 Nemotron。

之前我们曾把本地模型和 GPT-3.5 做过对比。现在回头看,除了 GPT-3.5,第二年的 GPT-4o 同样值得参照——一个代表"能用"的门槛,一个代表 2024 年第一梯队的标杆。这次的雷达图同时画上这两条基线。

模型有大有小。这次在单张 7900XTX 24GB 上,选了一批当前有代表性的模型——硬盘空间有限,不可能全装,只选不算太旧、各尺寸段有代表性的:小尺寸(≤1.2GB)、中尺寸(1.2-8GB)、大尺寸(>8GB,需 8G+ 显存)三档。核心问题只有一个:现在的开源模型,和当年的闭源模型相比,到底怎么样了?

所有模型均在同一张 7900XTX 上实测(六维基准各 30 题 + 单流生成速度 + 官方 BFCL 工具调用);闭源基线取公开可查证分数(出处逐项标注,见下表)。

所谓"六维",指下表参照基线里列出的六个基准,覆盖知识、代码、数学、常识推理四类能力,每维 30 题、"六维均分"即六项准确率的算术平均:

  • MMLU:多任务语言理解(专业/通识知识选择题);
  • HumanEval:代码生成(函数补全,pass@1);
  • GSM8K:小学数学应用题(多步推理);
  • HellaSwag:常识句子补全(反直觉干扰项);
  • ARC:科学/常识问答;
  • WinoGrande:指代消解(代词指向)。

工具调用方面:BFCL(Berkeley Function Calling Leaderboard)就是标准的工具调用评测,本次 22 个模型全部跑完 V4 Non-Live 七类 AST(见各档表格与专项表);ToolBench 是另一个更重的 agent 型工具调用基准(多步规划),仅 27B 家族六个模型有实测,主要体现出 27B 的 3.6 还是比 3.8 更好的选择。

参照基线:GPT-3.5 与 GPT-4o

维度 GPT-3.5-Turbo (2023) GPT-4o (2024) 出处
MMLU 70.0 88.7 GPT-4 Technical Report (arXiv:2303.08774) / OpenAI 官方
HumanEval 编程 48.1 90.2 同上 / OpenAI 官方(System Card + Azure AI 目录)
GSM8K 57.1 96.0* 同上 / *官方未发布,社区实测中位
HellaSwag 85.5 95.3* 同上 / *llm-stats 社区实测
ARC 85.2 95.5* 同上 / *llm-stats 社区实测
WinoGrande 81.6 88.5* 同上 / *llm-stats 社区实测
BFCL 工具调用(单轮 AST) 84.5 85.9 / 87.4 BFCL v3 官方榜单:GPT-3.5-Turbo-0125 (FC) AST 84.52(ToolACE 论文 arXiv:2409.00920 引 2024-09-20 榜单);GPT-4o-2024-08-06 AST 85.9(Amazon Nova 报告 arXiv:2506.12103 引 2024-11-17 榜单)、gpt-4o-2024-11-20 (FC) Non-Live AST 87.42(官方榜 2025-01-18 快照)
BFCL Overall(含多轮) 51.93(多轮仅 19.12) 68.9 / 69.6(多轮 63.4) 同上
生成速度 ~65 t/s (API) ~92 t/s (API) Artificial Analysis / llm-stats 实测中位

说明:①本地模型 BFCL 为 V4 七类 AST 平均,闭源为 v3 榜单口径,测试集版本不同,对比仅供参考;②GPT-3.5 的 BFCL Overall 只有 51.93,主因是多轮(19.12)拉胯——单轮工具调用它并不弱(84.5);③带 * 维度为官方未发布、取社区实测中位;④HumanEval 均为官方 0-shot/pass@1 口径。

一、小尺寸档(≤1.2GB)——秒开级轻骑兵

排名 型号 家族 参数量 量化 文件大小 代码 HumanEval 工具调用 BFCL 六维均分 生成 t/s
1 Qwen3 0.6B Alibaba Qwen3 0.75B Q4_K_M 0.52GB 53.3 65.5 47.2 250.9
2 Qwen3.5 0.8B Alibaba Qwen3.5 0.87B Q8_0 1.0GB 33.3 57.8 42.8 185.4
3 Granite4 0.35B IBM Granite 4.0 0.34B Q8_0 0.37GB 66.7 67.0 40.0 258.2
4 LFM2.5-Think 1.2B LiquidAI LFM2.5 1.2B Q4_K_M 0.73GB 30.0 72.3 28.3 355.9
5 LFM2.5 0.35B LiquidAI LFM2.5 0.35B Q8_0 0.38GB 3.3 45.9 24.4 374.4

特点:Qwen3 0.6B 微型全能底子;Qwen3.5 0.8B 新一代微型、数学强;Granite4 0.35B 企业级安全调优、MoE 混合架构;LFM2.5-Think 1.2B 思考型、小身材长推理;LFM2.5 0.35B 非Transformer混合架构。

Tiny (≤1.2GB)

这一档 5 个模型全部在 1.2GB 以内,加载秒开、生成速度 185-374 t/s 是全部参赛选手里最快的。共同短板也很明显:六维平均分只有 24-47,MMLU/数学都远远够不着 GPT-3.5 的边。它们的正确用法是高频轻任务文本翻译(短句翻译几乎瞬时返回,日常中英互译质量够用、速度是大模型的 3-5 倍)、分类、摘要、格式转换、意图路由——以及给大模型当"前置路由",判断该不该升级到大模型处理。代码能力分化明显:Granite4 0.35B 的 HumanEval 66.7 是本档意外亮点,Qwen3 0.6B 53.3 次之,LFM2.5 两兄弟(3-30 分)基本不会写代码。工具调用:本档 BFCL 实测 LFM2.5 0.35B 45.9、Granite4 0.35B 67.0、LFM2.5-Think 1.2B 72.3、Qwen3 0.6B 65.5、Qwen3.5 0.8B 57.8——远低于大模型档(77-89),简单单工具调用勉强可用(Granite 0.35B 的 multiple 85 出人意料),但平行调用和复杂 agent 别指望。

➡️ 本档推荐:Qwen3 0.6B(六维 47.2 分 + 250.9 t/s;本档首选翻译/摘要/路由等轻任务)

二、中尺寸档(1.2-8GB)——单卡实用主力

排名 型号 家族 参数量 量化 文件大小 代码 HumanEval 工具调用 BFCL 六维均分 生成 t/s
1 Gemma4 E4B Google Gemma4 4B 有效(总7.5B) Q4_K_M 5.0GB 100.0 81.9 83.4 115.0
2 Gemma4 12B Google Gemma4 11.9B Q4_K_M 7.1GB 83.3 77.6 80.6 62.4
3 Qwen3.5 9B Alibaba Qwen3.5 9.7B Q4_K_M 6.6GB 73.3 80.9 80.5 79.3
4 Gemma4 E2B Google Gemma4 2B 有效(总4.6B) Q4_K_M 3.1GB 100.0 79.7 75.0 154.9
5 OmniCoder2 9B 社区 OmniCoder 9.0B Q4_K_M 5.7GB 93.3 81.3 48.3 85.1

特点:Gemma4 E4B 性价比之王;Gemma4 12B 中量级标杆;Qwen3.5 9B 中坚全能;Gemma4 E2B 轻任务够用;OmniCoder2 9B 代码特化、通用偏科。

Mid (1.2-8GB)

这一档开始进入"真正能用"的区间:五个模型六维平均分 48-83,Gemma4 E4B 以 4B 参数拿到 83.4 分 + 115 t/s,超过 GPT-3.5 六维平均(71.2),是全场性价比最高的一档。代码能力全员过关:Gemma4 E2B/E4B 的 HumanEval 双双 100 分,OmniCoder2 93.3(不愧代码特化),Gemma4 12B 83.3 / Qwen3.5 9B 73.3 稳定。E2B(75 分)证明了 2B 就是日常轻聊天+轻代码的底线;Qwen3.5 9B 和 Gemma4 12B 是均衡中坚;OmniCoder 偏科严重(只会写代码,通用垫底 48.3)。工具调用:本档 5/5 模型完成 BFCL 实测(见上表),Qwen3.5/Gemma4 家族模板层均已验证支持 function calling。单卡日常主力建议从这档选——除非你确定需要旗舰级能力。

➡️ 本档推荐:Gemma4 E4B(六维 83.4 分 + HumanEval 100 + 115 t/s,性价比之王;工具调用已实测 BFCL 81.9,需要 function calling 的场景本档即可胜任)

三、大尺寸档(>8GB,需 8G+ 显存)——旗舰竞技场

排名 型号 家族 参数量 量化 文件大小 代码 HumanEval 工具调用 BFCL 六维均分 生成 t/s
1 Qwen3.6 35B MoE Alibaba Qwen3.6 34.7B(A3B) Q4_K_M 22.0GB 96.7 83.0 93.4 106.7
2 Gemma4 31B Google Gemma4 30.7B 稠密 Q4_K_M 18.0GB 100.0 83.6 91.7 29.3
3 Nemotron 3.5 Lightning NVIDIA 30B(A3B) Q4_0 18.9GB 100.0 79.7 91.1 129.0
4 Qwen 3.6 27B Q5Hyb Alibaba Qwen3.6 27B 稠密 Q5Hyb 20.6GB 100.0 89.4 90.5 29.91
5 Qwen 3.8 27B Q4_K_M Alibaba Qwen3.8 27B 稠密 Q4_K_M 16.8GB 100.0 86.0 90.0 37.94
6 Qwen 3.8 27B Q5Hyb Alibaba Qwen3.8 27B 稠密 Q5Hyb 20.6GB 100.0 85.1 90.0 30.22
7 Huihui 3.6 27B Q5Hyb Huihui 去审查 27B 稠密 Q5Hyb 20.6GB 100.0 89.2 89.4 30.73
8 Qwen 3.6 27B Q4_K_M Alibaba Qwen3.6 27B 稠密 Q4_K_M 17.0GB 100.0 88.3 88.9 36.32
9 Uncensored 3.8 27B Q5Hyb Heretic 去审查 27B 稠密 Q5Hyb 20.6GB 100.0 86.8 88.3 30.72
10 GLM4.7 Flash 智谱 GLM 29.9B MoE Q4_K_M 18.0GB 100.0 79.4 88.3 95.5
11 Gemma4 26B MoE Google Gemma4 25.2B(A4B) Q4_K_M 16.0GB 100.0 78.3 87.2 91.1
12 GPT-OSS 20B OpenAI gpt-oss 20.9B(A3.6B) Q4_K_M 11.0GB 86.7 52.9 78.9 155.0

特点:Qwen3.6 35B MoE 全场总分第一;Gemma4 31B 大杯旗舰、速度慢;Nemotron 3.5 Lightning Mamba2+MoE、agent 执行层;Qwen 3.6 27B Q5Hyb 定制混合量化(Q5主体+Q8注意力);Qwen 3.8 27B Q4_K_M 混合线性注意力架构;Qwen 3.8 27B Q5Hyb 定制混合量化;Huihui 3.6 27B Q5Hyb abliterated 去对齐;Qwen 3.6 27B Q4_K_M 官方标准量化;Uncensored 3.8 27B Q5Hyb 消融法去对齐;GLM4.7 Flash 国产旗舰 MoE 轻量版;Gemma4 26B MoE MoE 高效大杯;GPT-OSS 20B OpenAI 开源 MoE。

Large (>8GB, 8G+ VRAM)

12 个模型挤在这一档,也是和 GPT-4o 正面交锋的主战场。Qwen3.6 35B MoE 以 93.4 分 + 106.7 t/s 双料登顶,但是工具调用不如 27B 家族的,好在六维全面越过 GPT-4o 基线(89.5);Gemma4 31B(91.7 分)是稠密阵营最强但速度只有 29 t/s;Nemotron 3.5 Lightning(91.1 分 + 129 t/s)靠 Mamba2+MoE 架构拿到全场最快大模型;Qwen 27B 家族六个模型挤在 88.9-90.5 的密集区间——量化选择的影响(约 1 分)远小于家族差异。这一档全员在能力面上越过或贴住 GPT-4o,仅在速度轴被本地小模型反超。

本档工具调用专项实测——BFCL(V4 Non-Live AST 七类官方口径)12 个模型全部实测:

型号 BFCL 工具调用
Qwen3.6 35B MoE 83.0
Gemma4 31B 83.6
Nemotron 3.5 Lightning 79.7
Qwen 3.6 27B Q5Hyb 89.4
Qwen 3.8 27B Q4_K_M 86.0
Qwen 3.8 27B Q5Hyb 85.1
Huihui 3.6 27B Q5Hyb 89.2
Qwen 3.6 27B Q4_K_M 88.3
Uncensored 3.8 27B Q5Hyb 86.8
GLM4.7 Flash 79.4
Gemma4 26B MoE 78.3
GPT-OSS 20B 52.9

BFCL 七类中 simple_python 全员 93-97;Java/JS 是所有模型的洼地(60-78);3.8 家族 irrelevance(该拒判时不调用)明显弱于 3.6(70-75 vs 90),去审查版 Uncensored 更低至 47.9。

ToolBench-Static 专项实测(100 域内+50 域外抽样;仅 27B 家族六兄弟有实测,其余大模型未跑):

型号 ToolBench 域内 plan_em 域外 plan_em
Qwen 3.6 27B Q5Hyb 0.822 0.837
Qwen 3.8 27B Q4_K_M 0.822 0.857
Qwen 3.8 27B Q5Hyb 0.835 0.816
Huihui 3.6 27B Q5Hyb 0.800 0.816
Qwen 3.6 27B Q4_K_M 0.789 0.816
Uncensored 3.8 27B Q5Hyb 0.833 0.857

➡️ 本档推荐综合主力首选 Qwen 3.6 27B(Q5Hyb)——27B 量级能力均衡无短板,工具调用非常强(BFCL 89.4 全场第一、ToolBench 域内 0.822、六维 90.5 领先 27B 家族);且 3.8 在 27B 档并没有比 3.6 强太多(六维 90.0 vs 90.5 持平,工具调用反而落后 3-4 分),换代收益有限。要极致总分再上 Qwen3.6 35B MoE(六维 93.4 分,工具调用 实测 83.0);要速度选 Nemotron(129 t/s,BFCL 79.7,Java/JS 偏弱)。

四、全景:22 模型同场雷达

All 22 Models

排名 型号 参数量 文件大小 代码 HumanEval 工具调用 BFCL 六维平均分 生成 t/s
1 Qwen3.6 35B MoE 34.7B(A3B) 22.0GB 96.7 83.0 93.4 106.7
2 Gemma4 31B 30.7B 稠密 18.0GB 100.0 83.6 91.7 29.3
3 Nemotron 3.5 Lightning 30B(A3B) 18.9GB 100.0 79.7 91.1 129.0
4 Qwen 3.6 27B Q5Hyb 27B 稠密 20.6GB 100.0 89.4 90.5 29.91
5 Qwen 3.8 27B Q4_K_M 27B 稠密 16.8GB 100.0 86.0 90.0 37.94
6 Qwen 3.8 27B Q5Hyb 27B 稠密 20.6GB 100.0 85.1 90.0 30.22
7 Huihui 3.6 27B Q5Hyb 27B 稠密 20.6GB 100.0 89.2 89.4 30.73
8 Qwen 3.6 27B Q4_K_M 27B 稠密 17.0GB 100.0 88.3 88.9 36.32
9 Uncensored 3.8 27B Q5Hyb 27B 稠密 20.6GB 100.0 86.8 88.3 30.72
10 GLM4.7 Flash 29.9B MoE 18.0GB 100.0 79.4 88.3 95.5
11 Gemma4 26B MoE 25.2B(A4B) 16.0GB 100.0 78.3 87.2 91.1
12 Gemma4 E4B 4B 有效(总7.5B) 5.0GB 100.0 81.9 83.4 115.0
13 Gemma4 12B 11.9B 7.1GB 83.3 77.6 80.6 62.4
14 Qwen3.5 9B 9.7B 6.6GB 73.3 80.9 80.5 79.3
15 GPT-OSS 20B 20.9B(A3.6B) 11.0GB 86.7 52.9 78.9 155.0
16 Gemma4 E2B 2B 有效(总4.6B) 3.1GB 100.0 79.7 75.0 154.9
17 OmniCoder2 9B 9.0B 5.7GB 93.3 81.3 48.3 85.1
18 Qwen3 0.6B 0.75B 0.52GB 53.3 65.5 47.2 250.9
19 Qwen3.5 0.8B 0.87B 1.0GB 33.3 57.8 42.8 185.4
20 Granite4 0.35B 0.34B 0.37GB 66.7 67.0 40.0 258.2
21 LFM2.5-Think 1.2B 1.2B 0.73GB 30.0 72.3 28.3 355.9
22 LFM2.5 0.35B 0.35B 0.38GB 3.3 45.9 24.4 374.4

速度为单流实测(27B 取无 MTP 基线);六维=30题/维;GPT-3.5 基线六维平均 71.2,GPT-4o 约 89.2。颜色=家族,线型=家族内成员;黑色加粗虚线=GPT-3.5,灰色点划线=GPT-4o。

4.1 详细分数全表(22 模型六维明细 + BFCL 汇总)

六维明细(MMLU / HumanEval / GSM8K / HellaSwag / ARC / WinoGrande,各 30 题 acc;按文件大小升序):

型号 文件GB MMLU HumanEval GSM8K HellaSwag ARC WinoGrande 六维均分
Granite4 0.35B 0.37 40.0 66.7 23.3 33.3 26.7 50.0 40.0
LFM2.5 0.35B 0.38 26.7 3.3 6.7 23.3 46.7 40.0 24.4
Qwen3 0.6B 0.52 36.7 53.3 66.7 20.0 56.7 50.0 47.2
LFM2.5-Think 1.2B 0.73 23.3 30.0 46.7 20.0 13.3 36.7 28.3
Qwen3.5 0.8B 1.0 13.3 33.3 73.3 40.0 50.0 46.7 42.8
Gemma4 E2B 3.1 66.7 100.0 96.7 33.3 80.0 73.3 75.0
Gemma4 E4B 5.0 70.0 100.0 86.7 66.7 90.0 86.7 83.4
OmniCoder2 9B 5.7 13.3 93.3 80.0 23.3 30.0 50.0 48.3
Qwen3.5 9B 6.6 66.7 73.3 90.0 80.0 90.0 83.3 80.5
Gemma4 12B 7.1 70.0 83.3 66.7 80.0 96.7 86.7 80.6
GPT-OSS 20B 11.0 63.3 86.7 90.0 63.3 93.3 76.7 78.9
Gemma4 26B MoE 16.0 66.7 100.0 76.7 90.0 96.7 93.3 87.2
Qwen 3.8 27B Q4_K_M 16.8 66.7 100.0 96.7 93.3 100.0 83.3 90.0
Qwen 3.6 27B Q4_K_M 17.0 70.0 100.0 100.0 86.7 93.3 83.3 88.9
GLM4.7 Flash 18.0 73.3 100.0 93.3 80.0 93.3 90.0 88.3
Gemma4 31B 18.0 86.7 100.0 76.7 93.3 100.0 93.3 91.7
Nemotron 3.5 Lightning 18.9 90.0 100.0 90.0 76.7 93.3 96.7 91.1
Huihui 3.6 27B Q5Hyb 20.6 70.0 100.0 100.0 93.3 93.3 80.0 89.4
Qwen 3.6 27B Q5Hyb 20.6 73.3 100.0 100.0 90.0 93.3 86.7 90.5
Qwen 3.8 27B Q5Hyb 20.6 70.0 100.0 96.7 90.0 100.0 83.3 90.0
Uncensored 3.8 27B Q5Hyb 20.6 66.7 100.0 93.3 86.7 100.0 83.3 88.3
Qwen3.6 35B MoE 22.0 96.7 96.7 86.7 93.3 100.0 86.7 93.4

BFCL 工具调用汇总(27B 家族为官方 Non-Live Overall Acc,其余为 V4 七类 AST 平均):

型号 文件GB BFCL 工具调用
Granite4 0.35B 0.37 67.0
LFM2.5 0.35B 0.38 45.9
Qwen3 0.6B 0.52 65.5
LFM2.5-Think 1.2B 0.73 72.3
Qwen3.5 0.8B 1.0 57.8
Gemma4 E2B 3.1 79.7
Gemma4 E4B 5.0 81.9
OmniCoder2 9B 5.7 81.3
Qwen3.5 9B 6.6 80.9
Gemma4 12B 7.1 77.6
GPT-OSS 20B 11.0 52.9
Gemma4 26B MoE 16.0 78.3
Qwen 3.8 27B Q4_K_M 16.8 86.0
Qwen 3.6 27B Q4_K_M 17.0 88.3
GLM4.7 Flash 18.0 79.4
Gemma4 31B 18.0 83.6
Nemotron 3.5 Lightning 18.9 79.7
Huihui 3.6 27B Q5Hyb 20.6 89.2
Qwen 3.6 27B Q5Hyb 20.6 89.4
Qwen 3.8 27B Q5Hyb 20.6 85.1
Uncensored 3.8 27B Q5Hyb 20.6 86.8
Qwen3.6 35B MoE 22.0 83.0

4.2 27B 家族深挖数据对比(拒答率 / τ² / MTP / ToolBench 幻觉率 / BFCL irrelevance)

结论里提到的拒答率、irrelevance 拒判、MTP 加速、τ² 智能体等,原始实测数据如下(27B 家族六个模型;τ² 为本地 user-sim 口径、非官方协议;拒答率越低越不拘束):

型号 拒答率 τ² 成功率 MTP n=3 t/s MTP 加速比 无MTP t/s ToolBench 幻觉率(域内/域外) BFCL irrelevance
Qwen 3.8 27B Q4_K_M 0.05 100% 66.4 1.75x 37.9 0.03 / 0.04 74.6
Qwen 3.6 27B Q4_K_M 0.15 93% 60.2 1.66x 36.3 0.03 / 0.02 90.0
Qwen 3.6 27B Q5Hyb 0.15 93% 55.1 1.84x 29.9 0.05 / 0.04 90.0
Qwen 3.8 27B Q5Hyb 0.05 100% 59.7 1.98x 30.2 0.00 / 0.00 70.4
Huihui 3.6 27B Q5Hyb 0.00 93% 65.2 2.12x 30.7 0.02 / 0.02 90.0
Uncensored 3.8 27B Q5Hyb 0.05 93% 59.4 1.94x 30.7 0.00 / 0.00 47.9

读法:拒答率 huihui 全量微调去对齐最彻底(0.0),官方版 0.05-0.15;τ² 成功率 3.8 家族两兄弟 100%、其余 93%;MTP 加速 全部 1.66-2.12x;幻觉率 3.8 家族(0.00-0.04)普遍低于 3.6(0.02-0.05);irrelevance 拒判 3.6 家族 90 明显强于 3.8(70-75),去审查版 Uncensored 掉到 47.9——这正是结论 3 判断"3.6 工具调用更强"的原始依据。

五、结论

  1. 开源已追平 2024 闭源第一梯队:大尺寸档冠军 Qwen3.6 35B MoE(93.4 分)全面越过 GPT-4o 基线,前十名大模型全部在能力面上贴住或超过 GPT-4o。

  2. MoE 是当前甜点架构:总榜前十中 MoE 占四席(Qwen3.6 35B、Nemotron、GPT-OSS、Gemma4 26B),且速度普遍 90-130 t/s,比同档稠密模型快 3-4 倍。

  3. 工具调用的主力推荐:Qwen 3.6 27B(首选 Q5Hyb,其次官方 Q4_K_M)——27B 这个量级能力均衡没有短板:六维 88.9-90.5、BFCL 工具调用 88.3-89.4(27B 档全员 85+,非常强)、ToolBench 域内 0.79-0.82、拒答率克制(官方 0.15)、还有 MTP 1.7-2.1x 加速可用。更关键的判断是:在 27B 档,Qwen 3.8 并没有比 3.6 强太多——六维 90.0 vs 90.5、MMLU 70.0 vs 73.3 基本持平,而 3.6 在最要紧的工具调用上明显领先(BFCL 88.3-89.4 vs 85.1-86.8,irrelevance 拒判 90 vs 70-75),甚至超过 GPT-4o 的单轮工具调用(87.4,v3 榜口径,版本不同仅供参考)。换代收益有限,选能力更全面、工具调用更强的 3.6,才是单卡日常主力的正解。

  4. 按量级选型:轻任务/翻译/路由 Qwen3 0.6B(250 t/s);中量级性价比 Gemma4 E4B(83 分+115 t/s);旗舰总分 Qwen3.6 35B MoE(93.4 分);均衡主力 Qwen 3.6 Q5Hyb(见结论 3);要极致速度的大模型选 Nemotron(129 t/s)。

  5. 速度与能力要做好取舍:大尺寸 MoE 已经同时给出 90+ 分和 100+ t/s,真正的取舍只存在于"极致速度(小模型 250 t/s+)"和"极致能力(93+ 分)"之间。