Qwen3.8:27B 本地部署:从 52G 的 f16 到 7G 的 IQ1_S阶梯量化实测,AMD的7900XTX 24G和 NVIDIA的4070 8G都跑一遍
先说结论:
- 24G 卡追求质量:Q8SLIM,22.3 GiB 全进显存,29 tok/s,这是 7900XTX 上能摸到的最高参数规格。
- 24G 卡追求速度:IQ4_XS,39.6 tok/s,质量验证 …
先说结论:
Liquid AI 的 LFM2.5-350M 最近在 Spark Arena https://spark-arena.com/leaderboard 上长期居于速度榜首。这个模型在 Ollama 上可以直接拉取:
ollama pull LiquidAI/lfm2.5-350m
只有 379MB,Q8_0 量化,354.48M 参 …
低配机器的本地模型,绕不开一个矛盾:模型越小跑得越快,但能力也越弱。在一些不具备大显存独显的设备上,"超小模型"(参 …
对于手头只有一台最低配 MacBook Air(M4,16G 统一内存,256G 硬盘)的朋友来说,能不能本地跑一个 9B 模型,还能不能用起来?答案是可以 …
对于老鸟来说,本地部署模型,肯定是vllm或者sglang又或者llama.cpp之类的。 但对新手来说,可能还是Ollama更为友好简单。 考虑到很多古老设备可能未必有高性能的GPU,而 Ollama 上 …
原创
说实话,这个项目的起因挺简单的。
人过三十天过午,我记忆力一直也不好,平时写课件讲义,经常要查文档,numpy 怎么用、pandas …
本文将详细介绍如何使用 LLaMA-Factory 对本地自定义数据进行模型微调,并将微调后的模型导出为 GGUF 格式,最终通过 Ollama 加载运行。整 …
本地环境的模型搭建和微调是一个复杂的过程,涉及多个组件的安装和配置。本文将介绍如何使用 Ollama、OpenWebUI 和 LlamaFactory 来搭建一个 …
很多朋友可能也在用Ollama来下载和管理模型,下载速度还不错,而且功能也简便,最新版本的Ollama更是提供了一个简洁的GUI,可以直接选择模型对话,还能地对模型下载位置 …
大模型的使用,如果仅局限于简单对话,其实是很难发挥出全部效用的,也很难构成完整的生产力。
组织和编排才是更高效 …
现在本地部署的大模型,有可能有一个问题,就是经常是“真空中的模型”,不具备当前环境的“感知”,很难用于回答与本机或当 …
上次的小模型批量测试对于需要速度的场景来说也就是可以看个乐,对于需要质量的情况来说,可能就完全不够看了。毕 …
谷歌好像是最近刚发了gemma3:0.27b,也就是gemma3:270m的版本,这个可是比qwen3:0.6b还要轻量级很多。 这个版本的在线测评倒是不少了,但正如之前咱们谈论过 …
前些天,在千问的一个官方群里,有朋友询问4060笔记本显卡是否能够运行gpt-oss:20b模型,群里的一些朋友表示这几乎是不可能的。 类似地,之前关于Void编辑器搭配本地模型的一篇文章中也有读者 …
之前的文章介绍了Void 编辑器, 又介绍了基于 Ollama 的 Qwen3-4B-2507 模型部署,这个模型特别轻量级,甚至可以在千元红米手机上流畅运行 …
昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,看到千问官方群里一位群友在手机上运行,感觉很厉害,得知mnn chat就可以部署,于是就动手试试看 …
昨天千问发布了最新的Qwen3-4b-Instruct-2507 和Qwen3-4b-Thinking-2507 模型,有如下两个亮点:
1.Qwen3-4B-Instruct-2507 的通用能力超越了商业闭源的小尺寸模型 GPT-4.1-nano,与中等规模的 …
OllamaModelManager[1] 是一个图形化界面工具,用于快速导出导入已经下载好的Ollama模型,新加了一个功能,可以更新和删除模型了。
去年就写过一 …
一直以来,我都痴迷于本地模型。
一方面是我所在地区的网速实在不理想,另一方面是我不太信任云服务。
最近好像有个消 …
之前随手发过使用ollama本地部署qwen3-30b-a3b-thinking_q8 以及 qwen3-30b-a3b-instruct_q8 的简单命令。
有的朋友问是如何将刚发布不久的模型从modelscope或者huggingface转换成ollama上的文件的。
其实思路很简单,就是下载模型,然 …