MoXing新升级:直接夺舍 Ollama ,部分模型提速 50%

之前已经介绍了MoXing这个小工具,实际上就是llama.cpp的一个封装,最近做了点改进,让MoXing可以直接运行Ollama的模型,结果意外发现,有的模型,在同样的硬件,同样的问题,MoXing 对比Ollama能提速 50%。

当然了,也有一些模型不能运行。。。

本文所叙的过程是在 Apple M4(16GB 统一内存)测试的。

成功案例:OmniCoder-9B

carstenuhlig/omnicoder-9b 模型:

指标 Ollama 原生 MoXing 提升
生成速度 ~10 tokens/s ~15 tokens/s +50%

Image

Image

已关注

Follow

Replay Share Like

Close

观看更多

更多

切换到竖屏全屏退出全屏

CycleUser已关注

Share Video

,时长01:04

0/0

00:00/01:04

切换到横屏模式

继续播放

进度条,百分之0

Play

00:00

/

01:04

01:04

倍速

倍速播放中

0.5倍0.75倍1.0倍1.5倍2.0倍

超清流畅

 Your browser does not support video tags

继续观看

MoXing新升级:直接夺舍 Ollama ,部分模型提速 50%

观看更多

,

MoXing新升级:直接夺舍 Ollama ,部分模型提速 50%

CycleUser已关注

Share点赞Wow

Added to Top StoriesEnter comment

Video Details

不成功案例:LFM2.5

lfm2.5-thinking 模型:

$ moxing ollama serve lfm2.5-thinking
Server failed to start!llama_model_load: error loading model: missing tensor 'token_embd_norm.weight'

结论:不是所有模型都能用 MoXing 运行,但能运行的模型好像会更快。

MoXing 是什么?

MoXing 直接读取 GGUF 格式文件(Ollama 的模型文件也是GGUF),用 llama.cpp 运行。

工作流程:

1.读取 Ollama manifest 文件2.找到 GGUF blob 文件3.用 llama.cpp 启动服务

使用方法

安装

pip install moxing

查看 Ollama 模型

moxing ollama list

运行模型

# 尝试运行moxing ollama serve carstenuhlig/omnicoder-9b
# 或者交互式选择moxing ollama list --select

建议:直接尝试你的模型,能跑就跑,不能跑就用回 Ollama。

总结

MoXing 的价值:

•对兼容的模型:更快(实测 +50%)•直接使用 Ollama 已下载的模型•OpenAI API 兼容•不是所有模型都能工作

MoXing 不是要取代 Ollama,而是提供一个更快的选择。

链接

•GitHub: https://github.com/cycleuser/MoXing[1]•PyPI: https://pypi.org/project/moxing/[2]

References

[1]https://github.com/cycleuser/MoXing [2]https://pypi.org/project/moxing/

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇TransPaste:本地 AI 翻译工具新版本升级后支持更多细粒度的翻译控制下一篇MoXing 和 Ollama 对比:从omnicoder-9b到更多模型

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%