MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型

在大语言模型(LLM)日益普及的今天,很多人希望能在本地运行自己的模型。然而,对于使用AMD显卡的用户来说,配置ROCm环境是个令人一些同学疼的问题。而NVIDIA的显卡,价格真是让我高攀不起。

我手上有台很古老的E5V3之类的机器,上面搭配的是RX590-2304SP显卡,有8G显存,但年代过于古老,不被当前的ROCm支持,配置Ollama For AMD也有点麻烦。

这种情况下,想要运行本地模型,那就不如直接用llama.cpp,然后做个Python封装。

于是就用Python攒了一个简单易用的工具——MoXing(模型),就是一个llama.cpp的Python封装,提供OpenAI API兼容接口,最重要的是可以根据运行的平台自动下载对应的二进制文件,比如就支持Vulkan后端,让我这种旧的AMD显卡用户也能轻松运行本地模型。

本文将以Windows 11系统、AMD RX590 2304显卡为例,演示如何使用MoXing运行OmniCoder-9B模型。


一、安装MoXing

MoXing的安装非常简单,只需要一行pip命令:

pip install moxing

安装过程中会自动处理所有依赖项,包括:

  • httpx - HTTP客户端
  • pydantic - 数据验证
  • rich - 美化终端输出
  • typer - CLI框架
  • psutil - 系统监控

安装成功后,你将看到如下输出:

Successfully installed moxing-0.1.5

💡 提示:建议在conda里面新建一个虚拟环境中安装,避免与其他项目的依赖冲突。


二、下载模型

本文使用的是OmniCoder-9B的GGUF量化版本,这个模型的地址在 https://www.modelscope.cn/models/Tesslate/OmniCoder-9B-GGUF/file/view/master/omnicoder-9b-q4_k_m.gguf?status=2

选用q4_k_m,是因为这个量化正好能在8G显存上流畅运行,性能也还对付。可以从ModelScope下载:

modelscope download --model Tesslate/OmniCoder-9B-GGUF omnicoder-9b-q4_k_m.gguf --local_dir ~/Downloads/

参数说明

  • --model Tesslate/OmniCoder-9B-GGUF:指定模型仓库
  • omnicoder-9b-q4_k_m.gguf:选择Q4_K_M量化版本(约5.3GB)
  • --local_dir ~/Downloads/:下载到指定目录

下载完成后,你将得到一个约5.34GB的GGUF模型文件。

📝 关于量化:Q4_K_M是一种平衡了模型大小和性能的量化方案,适合8GB显存的显卡。如果显存更大,可以选择Q5_K_M或Q8_0获得更好的效果。


三、启动服务

首次运行

进入模型所在目录,执行以下命令启动服务:

moxing serve ~/Downloads/omnicoder-9b-q4_k_m.gguf

首次运行时,MoXing会自动下载llama.cpp的预编译二进制文件:

Downloading llama.cpp binaries...
Found release: b8392
Downloading: llama-b8392-bin-win-vulkan-x64.zip
Extracting binaries...
  Extracted: ggml-vulkan.dll
  Extracted: llama-server.exe
  ...
Binaries installed to: C:\Users\<用户名>\.cache\moxing\binaries\windows

这个下载过程只需要一次,后续使用会直接使用缓存。

GPU检测

如果首次运行时设备检测超时,MoXing会回退到CPU模式:

Warning: Device detection failed: Command timed out after 30 seconds
Backend: cpu
Device: CPU (cpu, unknown)

不用担心,再次运行命令即可正常检测到GPU。

成功运行

成功检测到AMD显卡后,你会看到如下配置信息:

╭────────────            Configuration             ────────────╮
 Model: omnicoder-9b-q4_k_m.gguf                              
 Backend: vulkan                                              
 Device: AMD Radeon RX590 GME (vulkan, 8.0GB)                 
 GPU Layers: all                                              
 Context: 4096                                                
 GPU offload with limited context; GPU: AMD Radeon RX590 GME  
╰──────────────────────────────────────────────────────────────╯

这说明MoXing已成功识别到你的AMD显卡,并使用Vulkan后端进行GPU加速!

服务启动后的地址信息:

╭────────── moxing server ────────────────────╮
│ Server running at: http://127.0.0.1:8080    │
│ OpenAI API: http://127.0.0.1:8080/v1        │
│ Press Ctrl+C to stop                        │
╰─────────────────────────────────────────────╯

四、使用OpenAI API调用

服务启动后,你可以像使用OpenAI API一样调用本地模型,可以用在 Void 为代表的编辑器上,实际上我现在写这个文档用的就是 Void 搭配的这个OmniCoder-9b模型。

另外还可以在Python里面运行,以下是Python示例代码:

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8080/v1", api_key="none")

response = client.chat.completions.create(
    model="llama",
    messages=[{"role": "user", "content": "用Python写一个快速排序算法"}]
)

print(response.choices[0].message.content)

就是这么简单!你的本地模型已经可以通过标准的OpenAI SDK来调用了。


五、性能表现

在AMD RX590 GME(8GB显存)上运行OmniCoder-9B Q4_K_M模型:

指标 数值
模型大小 5.34 GB
推理速度 ~14 tokens/s
显存占用 约7.5 GB

对于这个价位的显卡来说,性能表现相当不错!

Image

MoXing运行截图

已关注

Follow

Replay Share Like

Close

观看更多

更多

切换到竖屏全屏退出全屏

CycleUser已关注

Share Video

,时长01:31

0/0

00:00/01:31

切换到横屏模式

继续播放

进度条,百分之0

Play

00:00

/

01:31

01:31

倍速

倍速播放中

0.5倍0.75倍1.0倍1.5倍2.0倍

超清流畅

 Your browser does not support video tags

继续观看

MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型

观看更多

,

MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型

CycleUser已关注

Share点赞Wow

Added to Top StoriesEnter comment

Video Details


六、更多命令

MoXing提供了丰富的命令行工具:

命令 说明
moxing serve 启动OpenAI兼容服务器
moxing chat 交互式对话
moxing bench 性能测试
moxing speed 快速速度测试
moxing devices 列出GPU设备
moxing models 列出可用模型
moxing download 下载模型

例如,查看你的GPU设备:

moxing devices

输出:

Available Devices
+----------------------------------------------------------------+
| #   | Name                 | Backend | Memory | Free  | Vendor |
|-----+----------------------+---------+--------+-------+--------|
| 0   | AMD Radeon RX590 GME | vulkan  | 8.0GB  | 7.2GB | amd    |
+----------------------------------------------------------------+

七、总结

MoXing为AMD显卡用户提供了极为便捷的本地模型运行方案:

零配置:自动检测GPU,自动下载依赖 Vulkan支持:兼容AMD、Intel、NVIDIA显卡 OpenAI兼容:无需修改现有代码 开箱即用:pip安装即可使用

如果你也在使用AMD显卡,不妨试试MoXing,让本地模型推理不再是难题!


相关链接

  • MoXing GitHub: https://github.com/cycleuser/MoXing
  • llama.cpp: https://github.com/ggml-org/llama.cpp
  • OmniCoder-9B: https://modelscope.cn/models/Tesslate/OmniCoder-9B-GGUF

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇OpenCode Skills:分享一套自己乱写的还算实用的 AI 编码技能库下一篇Void + MoXing:低成本方案用RX580显卡本地运行qwen3.5:9B模型,打造类Cursor体验

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%