昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,看到千问官方群里一位群友在手机上运行,感觉很厉害,得知mnn chat就可以部署,于是就动手试试看,顺便记录下来过程。
我所用设备为红米Note12T Pro (联发科天玑8200-Ultra + 12G RAM + 512G ROM),在手机上运行这两个模型,居然还能不错。
因此有本文简单介绍如何在Android设备上使用mnn chat本地部署和运行 Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型。
安装应用
最新版本请访问阿里巴巴的MNN项目下的Android应用页面[1]获取安装包
也可以直接访问阿里巴巴官方CDN的下载链接 https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk[2]下载安装包。
或者也可以尝试在应用市场中搜索,Play Store 里面是有的,其他的应用商店或许也有。
下载模型
打开 mnn chat,在顶部将下载源从huggingface切换成modelscope,然后,选择 Qwen3-4b-Instruct-2507 或者 Qwen3-4b-Thinking-2507 模型,就可以下载到本地了。
看尺寸应该是q4量化的?

测试性能
用了一个简单的问题“阶乘和圆周率有什么关系”测试了一下,所用设备为红米Note12T Pro (联发科天玑8200-Ultra + 12G RAM + 512G ROM)。
Qwen3-4b-Thinking-2507 模型能达到约 3 tokens/s。
Qwen3-4b-Instruct-2507 模型能达到约 5 tokens/s。
阿里巴巴的 MNN 框架速度确实不错,感觉比 llama.cpp 要快不少好像。 虽然 3-5 tokens/s 的速度绝对不算快,也足够日常的离线场景简单应急了。
相关链接
•Qwen3-4B超顶小模型更新登场!手机也能轻松跑!•阿里巴巴 MNN 框架[3]•Qwen 模型介绍[4]
References
[1] 阿里巴巴的MNN项目下的Android应用页面: https://github.com/alibaba/MNN/blob/master/apps/Android/MnnLlmChat/README_CN.md#releases
[2] 阿里巴巴官方CDN的下载链接 https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk: https://meta.alicdn.com/data/mnn/mnn_chat_0_6_8.apk
[3] 阿里巴巴 MNN 框架: https://github.com/alibaba/MNN/
[4] Qwen 模型介绍: https://modelscope.cn/collections/Qwen3-9743180bdc6b48
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇Qwen3-4B-2507 模型的 Ollama 部署指南下一篇Void+Ollama+Qwen3-4B-2507构建完全离线运行的本地AI辅助开发环境
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%