前情提要:
我之前一直用 OpenLaoKe 写教学代码,我自己用的是24G显存的7900xtx,跑了一个Qwen3.5:35b-a3b,感觉进行小规模代码的修改等等还挺好用的。如果没有本地显卡的情况下,那就得用在线模型了,在线模型性能更强大,速度更快。但是有个问题——不仅得联网,还得有 API Key,说白了得花钱。可是,有时候不是说舍不得花钱,而是可能联网有些麻烦,再比如可能有时候我就想随便试个东西,或者写个私密项目不想代码跑到别人服务器上去。
在这之前,OpenLaoKe 需要依赖 Ollama 或者 LM Studio 来运行模型,没办法自己独立运行。这配置起来还是比较麻烦,对于新手朋友来说实在是过于复杂,有的朋友反映出错的信息都对新手不太友好。
于是,这几天给 OpenLaoKe 加了本地模型支持,现在可以完全离线跑了,终于可以一个 API Key 都不用。
啥是本地模型?
就是下载一个 .gguf 文件到咱自己电脑上,然后用 llama-cpp-python 跑推理。跟 Ollama 那种思路差不多,但这次是直接内置到 OpenLaoKe 里的,不用额外装 Ollama。
说白了就是:下载模型文件,本地跑,GPU也行,CPU也行,下载完成之后就完全不需要联网了,整个过程零费用。
咋用?
三步:
- 安装:
pip install openlaoke[local],那个[local]会顺带装上 llama-cpp-python - 下载模型:
openlaoke model download unsloth/Qwen3.5-0.8B-GGUF,然后就会在modelscope上面搜索相关模型,给出列表,然后输入序号选择下载就行了。
% openlaoke model download unsloth/Qwen3.5-0.8B-GGUF
Fetching files for unsloth/Qwen3.5-0.8B-GGUF...
Available GGUF files:
[1] mmproj-F16.gguf (195 MB)
[2] mmproj-BF16.gguf (198 MB)
[3] Qwen3.5-0.8B-UD-IQ2_XXS.gguf (323 MB)
[4] Qwen3.5-0.8B-UD-IQ2_M.gguf (355 MB)
[5] Qwen3.5-0.8B-UD-IQ3_XXS.gguf (380 MB)
[6] mmproj-F32.gguf (384 MB)
[7] Qwen3.5-0.8B-UD-Q2_K_XL.gguf (398 MB)
[8] Qwen3.5-0.8B-Q3_K_S.gguf (420 MB)
[9] Qwen3.5-0.8B-Q3_K_M.gguf (448 MB)
[10] Qwen3.5-0.8B-UD-Q3_K_XL.gguf (469 MB)
[11] Qwen3.5-0.8B-IQ4_XS.gguf (470 MB)
[12] Qwen3.5-0.8B-IQ4_NL.gguf (483 MB)
[13] Qwen3.5-0.8B-Q4_0.gguf (484 MB)
[14] Qwen3.5-0.8B-Q4_K_S.gguf (485 MB)
[15] Qwen3.5-0.8B-Q4_K_M.gguf (508 MB)
[16] Qwen3.5-0.8B-Q4_1.gguf (510 MB)
[17] Qwen3.5-0.8B-UD-Q4_K_XL.gguf (533 MB)
[18] Qwen3.5-0.8B-Q5_K_S.gguf (543 MB)
[19] Qwen3.5-0.8B-Q5_K_M.gguf (563 MB)
[20] Qwen3.5-0.8B-UD-Q5_K_XL.gguf (578 MB)
[21] Qwen3.5-0.8B-Q6_K.gguf (609 MB)
[22] Qwen3.5-0.8B-UD-Q6_K_XL.gguf (735 MB)
[23] Qwen3.5-0.8B-Q8_0.gguf (774 MB)
[24] Qwen3.5-0.8B-UD-Q8_K_XL.gguf (1131 MB)
[25] Qwen3.5-0.8B-BF16.gguf (1446 MB)
Select file to download [1/2/3/4/5/6/7/8/9/10/11/12/13/14/15/16/17/18/19/20/21/22/23/24/25] (1): 24
- 启动:
openlaoke --config,配置向导里选第 3 项"Built-in GGUF Model",具体如下所示
% openlaoke --config
╭───────────────────────────────────────╮
│ OpenLaoKe Configuration Wizard │
│ Let's set up your AI coding assistant │
╰───────────────────────────────────────╯
Step 1: Choose your AI provider
[1] 🟠 Ollama (Local) ✓ local
[2] 🆓 OpenCode Zen (FREE) ✓ FREE (no key needed)
[3] 💻 Built-in GGUF Model (Local) ✓ local
[4] MiniMax ✓ stored
[5] Aliyun Coding Plan ✓ stored
[6] Anthropic needs setup
[7] OpenAI (GPT-4) needs setup
[8] Azure OpenAI needs setup
[9] Google AI (Gemini) needs setup
[10] Google Vertex AI needs setup
[11] AWS Bedrock needs setup
[12] xAI Grok needs setup
[13] Mistral AI needs setup
[14] Groq needs setup
[15] Cerebras needs setup
[16] Cohere needs setup
[17] DeepInfra needs setup
[18] Together AI needs setup
[19] Perplexity needs setup
[20] OpenRouter needs setup
[21] GitHub Copilot needs setup
[22] LM Studio (Local) ✓ local
[23] OpenAI-Compatible (Custom) ✓ stored
[24] Skip (configure later)
Select provider [1/2/3/4/5/6/7/8/9/10/11/12/13/14/15/16/17/18/19/20/21/22/23/24] (1): 3
Configuring local_builtin
Press Enter to use default value
Built-in GGUF Models
Small models that run locally on CPU
Option Model Size Status
[1] Qwen 3 0.6B 610 MB not downloaded
Alibaba's Qwen3 0.6B GGUF, excellent Chinese/English support
[2] Qwen 2.5 0.5B 469 MB not downloaded
Ultra-small Qwen2.5 0.5B, minimal resource usage
[3] Qwen 2.5 1.5B 1020 MB not downloaded
Qwen2.5 1.5B, good balance of speed and quality
[4] Qwen 2.5 3B 1890 MB not downloaded
Qwen2.5 3B, better reasoning and coding ability
Custom Downloaded Models
Option Model Size Status
[5] unsloth/Qwen3.5-0.8B-GGUF 1131 MB ✓ downloaded
Select model to use [1/2/3/4/5] (1): 5
✓ Configured built-in model: unsloth/Qwen3.5-0.8B-GGUF
Set local_builtin as your default provider? [y/n] (y): y
✓ Active provider set to: local_builtin
就这么简单,这些模型也都很小,基本上只要是个笔记本,就能跑最小的那个。
不止内置的,啥模型都能下
内置的四个不够用?没关系,可以从 ModelScope 上搜更多的 GGUF 模型:
openlaoke model search qwen3.5
这命令会在 ModelScope 上搜十几个组织发布的 GGUF 模型,包括 Qwen 官方、unsloth、bartowski、TheBloke 这些常用的,搜出来让你选,选完直接下。
比如上面的示范就是下了一个 unsloth/Qwen3.5-0.8B-GGUF:
openlaoke model download "unsloth/Qwen3.5-0.8B-GGUF"
会列出所有可用的量化版本,从最小的 IQ2 到最大的 BF16,你挑一个适合自己的就行。
量化版本自动替换:如果你之前下了一个低质量量化(比如 IQ2_XXS),再下载同仓库的高质量版本(比如 Q4_K_M),会自动把旧的删掉,不用手动清理。
切换模型:Ctrl+P
这个是我觉得最实用的功能。
在 OpenLaoKe 的交互界面里,按 Ctrl+P,就会弹出一个模型选择器,跟 VS Code 的 Ctrl+P 文件选择器一个路子。输入关键词过滤,上下箭头选,回车确认,模型就切过去了,而且会自动保存配置,下次启动还是你选的那个。
以前切模型得输 /model ollama/llama3 这种命令,现在按个 Ctrl+P 就搞定了,所有 provider 的所有型号都在一个列表里,Ollama 的、Anthropic 的、本地的,全混在一起随便选。
当然了,/model 命令也还在,也做了加强,会自动显示本地内置模型(包括自己下的),切换也会保存到配置文件了。
配置向导也有调整
以前配置向导只支持云端 provider,现在第 3 项就是"Built-in GGUF Model (Local)",选进去会列出所有内置模型和自定义下载的模型,没下载的可以直接在向导里下,下完就能用。
自定义下载的模型会单独显示一个表格,带 "✓ downloaded" 标记,跟其他的分开,一目了然。
小模型的适配
说实话,这些小模型的能力有限,所以做了一堆适配:
上下文窗口:默认用模型支持的最大值(Qwen3.5 是 262144),不用手动设了。如果你内存不够,可以用 /localconfig n_ctx 32768 调小。
系统提示词精简版:完整版有七八百 token,对大模型不算啥,但对小模型占了一成多上下文。切到本地模型时自动用精简版,大概三十来个 token。而且提示词里明确告诉模型"你是 OpenLaoKe",防止它认错自己。
温度和重复惩罚:默认温度 0.3(比常规的 0.7 低),重复惩罚 1.1,减少小模型复读的问题。
max_tokens 限制到 1024:小模型别指望写长篇大论,留给上下文的空间多点更实际。
自动截断:消息太长时,先截系统提示词,再删最早的消息,保留最近的上下文。
思考内容显示:Qwen3.5 会输出 `
` 标签包裹的思考过程,现在会解析出来用灰色斜体显示,你能看到模型咋想的。
蒸馏提示词模板:这个是我觉得最有用的功能。预置了 55 个常见指令的高质量 Q&A 示例,覆盖排序、查找、树、图、动态规划、文件操作、正则、Git、HTTP、数据库、测试、错误处理、OOP、Shell、异步、Docker、CI/CD、安全、日期、性能、代码质量、CLI、Web 框架、机器学习等场景。
工作原理很简单:你问"用Python写一个快速排序",系统自动匹配到排序模板,把参考答案注入到系统提示词里。小模型看到参考答案后,生成的代码质量明显提升。这相当于给小模型配了一本"参考书",零 API 费用,零推理延迟。
手动调参:/localconfig
新增了 /localconfig 命令(别名 /lc),可以随时调本地模型的参数:
/localconfig # 查看当前参数
/localconfig n_ctx 65536 # 调整上下文窗口
/localconfig temperature 0.5 # 调整温度
/localconfig repetition_penalty 1.2 # 调整重复惩罚
改完立即生效,自动保存到配置文件。
自定义模型会记住
以前有个问题:你用 openlaoke model download 下了一个自定义模型,重启 OpenLaoKe 就忘了,因为自定义模型信息只在内存里。
现在改了,自定义模型注册信息会存到 ~/.openlaoke/models/custom_models.json 里,重启以后自动加载。模型文件本来就在磁盘上不会丢,现在元数据也不会丢了。删模型也会从注册表里同步更新。
用 ModelScope 而不用 HuggingFace
这算是个面向大陆地区用户的决定。HuggingFace 访问不稳定,ModelScope 是阿里的平台,下载速度快,Qwen 系列模型也在上面有。搜索的时候会遍历上面的 GGUF。
完整命令列表
openlaoke model download [model_id] # 下载模型
openlaoke model list # 列出所有模型
openlaoke model search <关键词> # 搜索 ModelScope
openlaoke model remove <model_id> # 删除模型
openlaoke model info <model_id> # 查看模型详情
交互界面里:
- Ctrl+P:模型选择器
/model:查看或切换模型/model local_builtin/qwen3:0.6b:直接切到本地模型/localconfig:调整本地模型参数
说点实话
小模型嘛,能力肯定比不上 Claude、Qwen3.6-Flash 等等这些在线的模型,能写个简单的函数就不错了,复杂逻辑它确实搞不定。
但是,有些场景就够了。比如就想让 AI 帮我补个函数名,写个简单的正则,或者问个 Python 的语法问题,这种事不用花 API 费,本地的就够用。
还有一个好处就是隐私。代码不出本机,不经过任何服务器,对一些涉密项目来说这很重要。
以后如果硬件条件好了,换个大点的模型跑就行了,命令都一样,模型文件换一下就好。这东西嘛,好歹能用。
对了,量化版本别选太低的。IQ2_XXS 这种 2bit 的,质量损失严重,建议至少选 Q4_K_M 或者 Q5_K_M,效果好不少。
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
虚拟化,操作系统,以及一些小工具 · 目录
虚拟化,操作系统,以及一些小工具
上一篇修了TransPaste的4个bug下一篇自用的OpenCode Skill再次更新:22个skills重新打磨了一遍,顺路解决了OpenCode导致整个图形界面崩溃的问题
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%