千元红米手机运行本地大模型-基于mnn chat的Qwen3-4B-2507部署指南

昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,看到千问官方群里一位群友在手机上运行,感觉很厉害,得知mnn chat就可以部署,于是就动手试试看,顺便记录下来过程。

我所用设备为红米Note12T Pro (联发科天玑8200-Ultra + 12G RAM + 512G ROM),在手机上运行这两个模型,居然还能不错。

因此有本文简单介绍如何在Android设备上使用mnn chat本地部署和运行 Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型。

安装应用

最新版本请访问阿里巴巴的MNN项目下的Android应用页面[1]获取安装包

也可以直接访问阿里巴巴官方CDN的下载链接 https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk[2]下载安装包。

或者也可以尝试在应用市场中搜索,Play Store 里面是有的,其他的应用商店或许也有。

下载模型

打开 mnn chat,在顶部将下载源从huggingface切换成modelscope,然后,选择 Qwen3-4b-Instruct-2507 或者 Qwen3-4b-Thinking-2507 模型,就可以下载到本地了。

看尺寸应该是q4量化的?

Image

测试性能

用了一个简单的问题“阶乘和圆周率有什么关系”测试了一下,所用设备为红米Note12T Pro (联发科天玑8200-Ultra + 12G RAM + 512G ROM)。

Qwen3-4b-Thinking-2507 模型能达到约 3 tokens/s。Image

Qwen3-4b-Instruct-2507 模型能达到约 5 tokens/s。Image

阿里巴巴的 MNN 框架速度确实不错,感觉比 llama.cpp 要快不少好像。 虽然 3-5 tokens/s 的速度绝对不算快,也足够日常的离线场景简单应急了。

相关链接

Qwen3-4B超顶小模型更新登场!手机也能轻松跑!•阿里巴巴 MNN 框架[3]•Qwen 模型介绍[4]

References

[1] 阿里巴巴的MNN项目下的Android应用页面: https://github.com/alibaba/MNN/blob/master/apps/Android/MnnLlmChat/README_CN.md#releases [2] 阿里巴巴官方CDN的下载链接 https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk: https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk [3] 阿里巴巴 MNN 框架: https://github.com/alibaba/MNN/ [4] Qwen 模型介绍: https://modelscope.cn/collections/Qwen3-9743180bdc6b48

预览时标签不可点

Close

更多

Name cleared

赞赏二维码微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇Qwen3-4B-2507 模型的 Ollama 部署指南下一篇Void+Ollama+Qwen3-4B-2507构建完全离线运行的本地AI辅助开发环境

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%