之前已经介绍了MoXing这个小工具,实际上就是llama.cpp的一个封装,最近做了点改进,让MoXing可以直接运行Ollama的模型,结果意外发现,有的模型,在同样的硬件,同样的问题,MoXing 对比Ollama能提速 50%。
当然了,也有一些模型不能运行。。。
本文所叙的过程是在 Apple M4(16GB 统一内存)测试的。
成功案例:OmniCoder-9B
carstenuhlig/omnicoder-9b 模型:
| 指标 | Ollama 原生 | MoXing | 提升 |
|---|---|---|---|
| 生成速度 | ~10 tokens/s | ~15 tokens/s | +50% |


已关注
Follow
Replay Share Like
Close
观看更多
更多
切换到竖屏全屏退出全屏
CycleUser已关注
Share Video
,时长01:04
0/0
00:00/01:04
切换到横屏模式
继续播放
进度条,百分之0
Play
00:00
/
01:04
01:04
倍速
倍速播放中
0.5倍0.75倍1.0倍1.5倍2.0倍
超清流畅
继续观看
MoXing新升级:直接夺舍 Ollama ,部分模型提速 50%
观看更多
,
MoXing新升级:直接夺舍 Ollama ,部分模型提速 50%
CycleUser已关注
Share点赞Wow
Added to Top StoriesEnter comment
Video Details
不成功案例:LFM2.5
lfm2.5-thinking 模型:
$ moxing ollama serve lfm2.5-thinking
Server failed to start!llama_model_load: error loading model: missing tensor 'token_embd_norm.weight'
结论:不是所有模型都能用 MoXing 运行,但能运行的模型好像会更快。
MoXing 是什么?
MoXing 直接读取 GGUF 格式文件(Ollama 的模型文件也是GGUF),用 llama.cpp 运行。
工作流程:
1.读取 Ollama manifest 文件2.找到 GGUF blob 文件3.用 llama.cpp 启动服务
使用方法
安装
pip install moxing
查看 Ollama 模型
moxing ollama list
运行模型
# 尝试运行moxing ollama serve carstenuhlig/omnicoder-9b
# 或者交互式选择moxing ollama list --select
建议:直接尝试你的模型,能跑就跑,不能跑就用回 Ollama。
总结
MoXing 的价值:
•对兼容的模型:更快(实测 +50%)•直接使用 Ollama 已下载的模型•OpenAI API 兼容•不是所有模型都能工作
MoXing 不是要取代 Ollama,而是提供一个更快的选择。
链接
•GitHub: https://github.com/cycleuser/MoXing[1]•PyPI: https://pypi.org/project/moxing/[2]
References
[1]: https://github.com/cycleuser/MoXing
[2]: https://pypi.org/project/moxing/
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇TransPaste:本地 AI 翻译工具新版本升级后支持更多细粒度的翻译控制下一篇MoXing 和 Ollama 对比:从omnicoder-9b到更多模型
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%