前情提要:
MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型
Void + MoXing:低成本方案用RX580显卡本地运行qwen3.5:9B模型,打造类Cursor体验
MoXing其实就是对llama.cpp的一个python封装,好处是用起来比较简单,不用太复杂的配置,经过这几个月的陆续改进,目前基本可以在OpenCode本地模型调用的场景上使用了。

以我这台机器为例,本地有两块独立显卡,其中这块7900xtx显存有 24G,足够运行Qwen3.6-27B-Q5_K_M.gguf,之前实测能达到30tokens/s左右,比在线的可能稍慢一些,但也足够应付一些文档编撰之类的任务了。
这块显卡可能是目前性价比最高的选择,兼顾了显存和后端支持,rocm也有对应支持,vulkan也能用,而且性能还不错,实际用起来比我之前的4060ti和5060ti的16G版本都强多了。
不过要注意,显卡满载可能会有供电和散热的压力,这方面建议有充足的供电储备。

首先安装modelscope和moxing
pip install moxing modelscope -U
模型文件下载自 https://www.modelscope.cn/models/unsloth/Qwen3.6-27B-GGUF
下载模型所用的命令是
modelscope download --model unsloth/Qwen3.6-27B-GGUF Qwen3.6-27B-Q5_K_M.gguf --local_dir ./
Qwen3.6-27B-Q5_K_M.gguf,这个模型文件有19G多一点,正好在24G显存上足够运行,比Q4的还要能强一点,速度也不比Q4慢多少,Q4大概能有35tokens/s,Q5有30tokens/s左右,也够用了。
下载好之后,运行模型所用的命令是
moxing serve 'Qwen3.6-27B-Q5_K_M.gguf' -d gpu1 -b vulkan -c 131072
这里的 -d gpu1 是指定所用显卡,gpu1就是我机器上的 7900xtx,需要通过 moxing devices 命令来判断你自己设备上的gpu序号:

-b vulkan 是使用 vulkan 的后端来运行,速度会比rocm快一些,而且也支持很多rx580之类的上古显卡。
最后那个-c 是设置上下文,建议给opencode用的话,最少也得32768起步,我这显存还有点宽裕,所以用的更多一点。
运行成功后默认的网页访问地址是http://127.0.0.1:8080
用于填写给OpenCode用的 OpenAI API 是http://127.0.0.1:8080/v1API key 和模型名字随便写即可,因为实际上本地运行的是固定的上面定好的模型




使用 7900XTX 运行 Qwen3.6-27B-GGUF 效果如下面的视频所示:
已关注
Follow
Replay Share Like
Close
观看更多
更多
切换到竖屏全屏退出全屏
CycleUser已关注
Share Video
,时长07:49
0/0
00:00/07:49
切换到横屏模式
继续播放
进度条,百分之0
Play
00:00
/
07:49
07:49
倍速
倍速播放中
0.5倍0.75倍1.0倍1.5倍2.0倍
超清流畅
继续观看
Token自由-用MoXing在7900xtx-24G显卡上本地运行Qwen3.6-27B模型给OpenCode用来文档编撰润色
观看更多
转载
,
Token自由-用MoXing在7900xtx-24G显卡上本地运行Qwen3.6-27B模型给OpenCode用来文档编撰润色
CycleUser已关注
Share点赞Wow
Added to Top StoriesEnter comment
Video Details
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇MoXing 五月更新,算是来了个大扫除下一篇Vibe Coding 氛围编程案例-通过对话实现可用的快速查表工具
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%