在大语言模型(LLM)日益普及的今天,很多人希望能在本地运行自己的模型。然而,对于使用AMD显卡的用户来说,配置ROCm环境是个令人一些同学疼的问题。而NVIDIA的显卡,价格真是让我高攀不起。
我手上有台很古老的E5V3之类的机器,上面搭配的是RX590-2304SP显卡,有8G显存,但年代过于古老,不被当前的ROCm支持,配置Ollama For AMD也有点麻烦。
这种情况下,想要运行本地模型,那就不如直接用llama.cpp,然后做个Python封装。
于是就用Python攒了一个简单易用的工具——MoXing(模型),就是一个llama.cpp的Python封装,提供OpenAI API兼容接口,最重要的是可以根据运行的平台自动下载对应的二进制文件,比如就支持Vulkan后端,让我这种旧的AMD显卡用户也能轻松运行本地模型。
本文将以Windows 11系统、AMD RX590 2304显卡为例,演示如何使用MoXing运行OmniCoder-9B模型。
一、安装MoXing
MoXing的安装非常简单,只需要一行pip命令:
pip install moxing
安装过程中会自动处理所有依赖项,包括:
- httpx - HTTP客户端
- pydantic - 数据验证
- rich - 美化终端输出
- typer - CLI框架
- psutil - 系统监控
安装成功后,你将看到如下输出:
Successfully installed moxing-0.1.5
💡 提示:建议在conda里面新建一个虚拟环境中安装,避免与其他项目的依赖冲突。
二、下载模型
本文使用的是OmniCoder-9B的GGUF量化版本,这个模型的地址在 https://www.modelscope.cn/models/Tesslate/OmniCoder-9B-GGUF/file/view/master/omnicoder-9b-q4_k_m.gguf?status=2
选用q4_k_m,是因为这个量化正好能在8G显存上流畅运行,性能也还对付。可以从ModelScope下载:
modelscope download --model Tesslate/OmniCoder-9B-GGUF omnicoder-9b-q4_k_m.gguf --local_dir ~/Downloads/
参数说明:
--model Tesslate/OmniCoder-9B-GGUF:指定模型仓库omnicoder-9b-q4_k_m.gguf:选择Q4_K_M量化版本(约5.3GB)--local_dir ~/Downloads/:下载到指定目录
下载完成后,你将得到一个约5.34GB的GGUF模型文件。
📝 关于量化:Q4_K_M是一种平衡了模型大小和性能的量化方案,适合8GB显存的显卡。如果显存更大,可以选择Q5_K_M或Q8_0获得更好的效果。
三、启动服务
首次运行
进入模型所在目录,执行以下命令启动服务:
moxing serve ~/Downloads/omnicoder-9b-q4_k_m.gguf
首次运行时,MoXing会自动下载llama.cpp的预编译二进制文件:
Downloading llama.cpp binaries...
Found release: b8392
Downloading: llama-b8392-bin-win-vulkan-x64.zip
Extracting binaries...
Extracted: ggml-vulkan.dll
Extracted: llama-server.exe
...
Binaries installed to: C:\Users\<用户名>\.cache\moxing\binaries\windows
这个下载过程只需要一次,后续使用会直接使用缓存。
GPU检测
如果首次运行时设备检测超时,MoXing会回退到CPU模式:
Warning: Device detection failed: Command timed out after 30 seconds
Backend: cpu
Device: CPU (cpu, unknown)
不用担心,再次运行命令即可正常检测到GPU。
成功运行
成功检测到AMD显卡后,你会看到如下配置信息:
╭──────────── Configuration ────────────╮
│ Model: omnicoder-9b-q4_k_m.gguf │
│ Backend: vulkan │
│ Device: AMD Radeon RX590 GME (vulkan, 8.0GB) │
│ GPU Layers: all │
│ Context: 4096 │
│ GPU offload with limited context; GPU: AMD Radeon RX590 GME │
╰──────────────────────────────────────────────────────────────╯
这说明MoXing已成功识别到你的AMD显卡,并使用Vulkan后端进行GPU加速!
服务启动后的地址信息:
╭────────── moxing server ────────────────────╮
│ Server running at: http://127.0.0.1:8080 │
│ OpenAI API: http://127.0.0.1:8080/v1 │
│ Press Ctrl+C to stop │
╰─────────────────────────────────────────────╯
四、使用OpenAI API调用
服务启动后,你可以像使用OpenAI API一样调用本地模型,可以用在 Void 为代表的编辑器上,实际上我现在写这个文档用的就是 Void 搭配的这个OmniCoder-9b模型。
另外还可以在Python里面运行,以下是Python示例代码:
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8080/v1", api_key="none")
response = client.chat.completions.create(
model="llama",
messages=[{"role": "user", "content": "用Python写一个快速排序算法"}]
)
print(response.choices[0].message.content)
就是这么简单!你的本地模型已经可以通过标准的OpenAI SDK来调用了。
五、性能表现
在AMD RX590 GME(8GB显存)上运行OmniCoder-9B Q4_K_M模型:
| 指标 | 数值 |
|---|---|
| 模型大小 | 5.34 GB |
| 推理速度 | ~14 tokens/s |
| 显存占用 | 约7.5 GB |
对于这个价位的显卡来说,性能表现相当不错!

MoXing运行截图
已关注
Follow
Replay Share Like
Close
观看更多
更多
切换到竖屏全屏退出全屏
CycleUser已关注
Share Video
,时长01:31
0/0
00:00/01:31
切换到横屏模式
继续播放
进度条,百分之0
Play
00:00
/
01:31
01:31
倍速
倍速播放中
0.5倍0.75倍1.0倍1.5倍2.0倍
超清流畅
继续观看
MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型
观看更多
,
MoXing:低预算场景用RX580显卡轻松运行Qwen3.5-9b-q4_k_m模型
CycleUser已关注
Share点赞Wow
Added to Top StoriesEnter comment
Video Details
六、更多命令
MoXing提供了丰富的命令行工具:
| 命令 | 说明 |
|---|---|
moxing serve |
启动OpenAI兼容服务器 |
moxing chat |
交互式对话 |
moxing bench |
性能测试 |
moxing speed |
快速速度测试 |
moxing devices |
列出GPU设备 |
moxing models |
列出可用模型 |
moxing download |
下载模型 |
例如,查看你的GPU设备:
moxing devices
输出:
Available Devices
+----------------------------------------------------------------+
| # | Name | Backend | Memory | Free | Vendor |
|-----+----------------------+---------+--------+-------+--------|
| 0 | AMD Radeon RX590 GME | vulkan | 8.0GB | 7.2GB | amd |
+----------------------------------------------------------------+
七、总结
MoXing为AMD显卡用户提供了极为便捷的本地模型运行方案:
零配置:自动检测GPU,自动下载依赖 Vulkan支持:兼容AMD、Intel、NVIDIA显卡 OpenAI兼容:无需修改现有代码 开箱即用:pip安装即可使用
如果你也在使用AMD显卡,不妨试试MoXing,让本地模型推理不再是难题!
相关链接
- MoXing GitHub: https://github.com/cycleuser/MoXing
- llama.cpp: https://github.com/ggml-org/llama.cpp
- OmniCoder-9B: https://modelscope.cn/models/Tesslate/OmniCoder-9B-GGUF
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇OpenCode Skills:分享一套自己乱写的还算实用的 AI 编码技能库下一篇Void + MoXing:低成本方案用RX580显卡本地运行qwen3.5:9B模型,打造类Cursor体验
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%