qwen3最新的 qwen3-30b-a3b-2507感觉很棒,在8g显存的4060显卡上都能达到4-5tokens/s。

顺手把gguf生成,并且转成了ollama能用的q8量化版本,然后推送到了ollama的hub上面。
懒得折腾的同学,可以下载安装ollama,然后在终端运行下面的命令:
ollama run hopephoto/qwen3-30b-a3b-instruct_q8
就可以运行q8量化的通用模型,个人平时用这种感觉更快速更有效率。
ollama run hopephoto/qwen3-30b-a3b-thinking_q8
就可以运行q8量化的带思维链的推理模型,思维链内心戏比较足但有点慢。
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇OllamaModelManager安装包-图形化界面快速导出导入Ollama模型下一篇可能是最强本地代码模型?Qwen3-Coder-30B-A3B-Instruct 模型的 Ollama 部署指南
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%