OpenLaoKe 更新:本地 GGUF 模型,零 API 费用跑起来

前情提要:

OpenLaoKe(唠嗑):一个命令行AI助手

我之前一直用 OpenLaoKe 写教学代码,我自己用的是24G显存的7900xtx,跑了一个Qwen3.5:35b-a3b,感觉进行小规模代码的修改等等还挺好用的。如果没有本地显卡的情况下,那就得用在线模型了,在线模型性能更强大,速度更快。但是有个问题——不仅得联网,还得有 API Key,说白了得花钱。可是,有时候不是说舍不得花钱,而是可能联网有些麻烦,再比如可能有时候我就想随便试个东西,或者写个私密项目不想代码跑到别人服务器上去。

在这之前,OpenLaoKe 需要依赖 Ollama 或者 LM Studio 来运行模型,没办法自己独立运行。这配置起来还是比较麻烦,对于新手朋友来说实在是过于复杂,有的朋友反映出错的信息都对新手不太友好。

于是,这几天给 OpenLaoKe 加了本地模型支持,现在可以完全离线跑了,终于可以一个 API Key 都不用。

啥是本地模型?

就是下载一个 .gguf 文件到咱自己电脑上,然后用 llama-cpp-python 跑推理。跟 Ollama 那种思路差不多,但这次是直接内置到 OpenLaoKe 里的,不用额外装 Ollama。

说白了就是:下载模型文件,本地跑,GPU也行,CPU也行,下载完成之后就完全不需要联网了,整个过程零费用。

咋用?

三步:

  1. 安装:pip install openlaoke[local],那个 [local] 会顺带装上 llama-cpp-python
  2. 下载模型:openlaoke model download unsloth/Qwen3.5-0.8B-GGUF,然后就会在modelscope上面搜索相关模型,给出列表,然后输入序号选择下载就行了。
% openlaoke model download unsloth/Qwen3.5-0.8B-GGUF
Fetching files for unsloth/Qwen3.5-0.8B-GGUF...
Available GGUF files:
  [1] mmproj-F16.gguf (195 MB)
  [2] mmproj-BF16.gguf (198 MB)
  [3] Qwen3.5-0.8B-UD-IQ2_XXS.gguf (323 MB)
  [4] Qwen3.5-0.8B-UD-IQ2_M.gguf (355 MB)
  [5] Qwen3.5-0.8B-UD-IQ3_XXS.gguf (380 MB)
  [6] mmproj-F32.gguf (384 MB)
  [7] Qwen3.5-0.8B-UD-Q2_K_XL.gguf (398 MB)
  [8] Qwen3.5-0.8B-Q3_K_S.gguf (420 MB)
  [9] Qwen3.5-0.8B-Q3_K_M.gguf (448 MB)
  [10] Qwen3.5-0.8B-UD-Q3_K_XL.gguf (469 MB)
  [11] Qwen3.5-0.8B-IQ4_XS.gguf (470 MB)
  [12] Qwen3.5-0.8B-IQ4_NL.gguf (483 MB)
  [13] Qwen3.5-0.8B-Q4_0.gguf (484 MB)
  [14] Qwen3.5-0.8B-Q4_K_S.gguf (485 MB)
  [15] Qwen3.5-0.8B-Q4_K_M.gguf (508 MB)
  [16] Qwen3.5-0.8B-Q4_1.gguf (510 MB)
  [17] Qwen3.5-0.8B-UD-Q4_K_XL.gguf (533 MB)
  [18] Qwen3.5-0.8B-Q5_K_S.gguf (543 MB)
  [19] Qwen3.5-0.8B-Q5_K_M.gguf (563 MB)
  [20] Qwen3.5-0.8B-UD-Q5_K_XL.gguf (578 MB)
  [21] Qwen3.5-0.8B-Q6_K.gguf (609 MB)
  [22] Qwen3.5-0.8B-UD-Q6_K_XL.gguf (735 MB)
  [23] Qwen3.5-0.8B-Q8_0.gguf (774 MB)
  [24] Qwen3.5-0.8B-UD-Q8_K_XL.gguf (1131 MB)
  [25] Qwen3.5-0.8B-BF16.gguf (1446 MB)

Select file to download [1/2/3/4/5/6/7/8/9/10/11/12/13/14/15/16/17/18/19/20/21/22/23/24/25] (1): 24
  1. 启动:openlaoke --config,配置向导里选第 3 项"Built-in GGUF Model",具体如下所示
% openlaoke --config
╭───────────────────────────────────────╮
 OpenLaoKe Configuration Wizard        
 Let's set up your AI coding assistant │
╰───────────────────────────────────────╯

Step 1: Choose your AI provider

   [1]   🟠 Ollama (Local)                local
   [2]   🆓 OpenCode Zen (FREE)           FREE (no key needed)
   [3]   💻 Built-in GGUF Model (Local)   local
   [4]   MiniMax                          stored
   [5]   Aliyun Coding Plan               stored
   [6]   Anthropic                       needs setup
   [7]   OpenAI (GPT-4)                  needs setup
   [8]   Azure OpenAI                    needs setup
   [9]   Google AI (Gemini)              needs setup
   [10]  Google Vertex AI                needs setup
   [11]  AWS Bedrock                     needs setup
   [12]  xAI Grok                        needs setup
   [13]  Mistral AI                      needs setup
   [14]  Groq                            needs setup
   [15]  Cerebras                        needs setup
   [16]  Cohere                          needs setup
   [17]  DeepInfra                       needs setup
   [18]  Together AI                     needs setup
   [19]  Perplexity                      needs setup
   [20]  OpenRouter                      needs setup
   [21]  GitHub Copilot                  needs setup
   [22]  LM Studio (Local)                local
   [23]  OpenAI-Compatible (Custom)       stored
   [24]  Skip (configure later)

Select provider [1/2/3/4/5/6/7/8/9/10/11/12/13/14/15/16/17/18/19/20/21/22/23/24] (1): 3

Configuring local_builtin
Press Enter to use default value

Built-in GGUF Models
Small models that run locally on CPU

 Option  Model                                                         Size     Status
   [1]   Qwen 3 0.6B                                                   610 MB   not downloaded
         Alibaba's Qwen3 0.6B GGUF, excellent Chinese/English support
   [2]   Qwen 2.5 0.5B                                                 469 MB   not downloaded
         Ultra-small Qwen2.5 0.5B, minimal resource usage
   [3]   Qwen 2.5 1.5B                                                 1020 MB  not downloaded
         Qwen2.5 1.5B, good balance of speed and quality
   [4]   Qwen 2.5 3B                                                   1890 MB  not downloaded
         Qwen2.5 3B, better reasoning and coding ability

Custom Downloaded Models
 Option  Model                      Size     Status
   [5]   unsloth/Qwen3.5-0.8B-GGUF  1131 MB   downloaded

Select model to use [1/2/3/4/5] (1): 5

 Configured built-in model: unsloth/Qwen3.5-0.8B-GGUF

Set local_builtin as your default provider? [y/n] (y): y
 Active provider set to: local_builtin

就这么简单,这些模型也都很小,基本上只要是个笔记本,就能跑最小的那个。

不止内置的,啥模型都能下

内置的四个不够用?没关系,可以从 ModelScope 上搜更多的 GGUF 模型:

openlaoke model search qwen3.5

这命令会在 ModelScope 上搜十几个组织发布的 GGUF 模型,包括 Qwen 官方、unsloth、bartowski、TheBloke 这些常用的,搜出来让你选,选完直接下。

比如上面的示范就是下了一个 unsloth/Qwen3.5-0.8B-GGUF

openlaoke model download "unsloth/Qwen3.5-0.8B-GGUF"

会列出所有可用的量化版本,从最小的 IQ2 到最大的 BF16,你挑一个适合自己的就行。

量化版本自动替换:如果你之前下了一个低质量量化(比如 IQ2_XXS),再下载同仓库的高质量版本(比如 Q4_K_M),会自动把旧的删掉,不用手动清理。

切换模型:Ctrl+P

这个是我觉得最实用的功能。

在 OpenLaoKe 的交互界面里,按 Ctrl+P,就会弹出一个模型选择器,跟 VS Code 的 Ctrl+P 文件选择器一个路子。输入关键词过滤,上下箭头选,回车确认,模型就切过去了,而且会自动保存配置,下次启动还是你选的那个。

以前切模型得输 /model ollama/llama3 这种命令,现在按个 Ctrl+P 就搞定了,所有 provider 的所有型号都在一个列表里,Ollama 的、Anthropic 的、本地的,全混在一起随便选。

当然了,/model 命令也还在,也做了加强,会自动显示本地内置模型(包括自己下的),切换也会保存到配置文件了。

配置向导也有调整

以前配置向导只支持云端 provider,现在第 3 项就是"Built-in GGUF Model (Local)",选进去会列出所有内置模型和自定义下载的模型,没下载的可以直接在向导里下,下完就能用。

自定义下载的模型会单独显示一个表格,带 "✓ downloaded" 标记,跟其他的分开,一目了然。

小模型的适配

说实话,这些小模型的能力有限,所以做了一堆适配:

上下文窗口:默认用模型支持的最大值(Qwen3.5 是 262144),不用手动设了。如果你内存不够,可以用 /localconfig n_ctx 32768 调小。

系统提示词精简版:完整版有七八百 token,对大模型不算啥,但对小模型占了一成多上下文。切到本地模型时自动用精简版,大概三十来个 token。而且提示词里明确告诉模型"你是 OpenLaoKe",防止它认错自己。

温度和重复惩罚:默认温度 0.3(比常规的 0.7 低),重复惩罚 1.1,减少小模型复读的问题。

max_tokens 限制到 1024:小模型别指望写长篇大论,留给上下文的空间多点更实际。

自动截断:消息太长时,先截系统提示词,再删最早的消息,保留最近的上下文。

思考内容显示:Qwen3.5 会输出 `

` 标签包裹的思考过程,现在会解析出来用灰色斜体显示,你能看到模型咋想的。

蒸馏提示词模板:这个是我觉得最有用的功能。预置了 55 个常见指令的高质量 Q&A 示例,覆盖排序、查找、树、图、动态规划、文件操作、正则、Git、HTTP、数据库、测试、错误处理、OOP、Shell、异步、Docker、CI/CD、安全、日期、性能、代码质量、CLI、Web 框架、机器学习等场景。

工作原理很简单:你问"用Python写一个快速排序",系统自动匹配到排序模板,把参考答案注入到系统提示词里。小模型看到参考答案后,生成的代码质量明显提升。这相当于给小模型配了一本"参考书",零 API 费用,零推理延迟。

手动调参:/localconfig

新增了 /localconfig 命令(别名 /lc),可以随时调本地模型的参数:

/localconfig              # 查看当前参数
/localconfig n_ctx 65536  # 调整上下文窗口
/localconfig temperature 0.5  # 调整温度
/localconfig repetition_penalty 1.2  # 调整重复惩罚

改完立即生效,自动保存到配置文件。

自定义模型会记住

以前有个问题:你用 openlaoke model download 下了一个自定义模型,重启 OpenLaoKe 就忘了,因为自定义模型信息只在内存里。

现在改了,自定义模型注册信息会存到 ~/.openlaoke/models/custom_models.json 里,重启以后自动加载。模型文件本来就在磁盘上不会丢,现在元数据也不会丢了。删模型也会从注册表里同步更新。

用 ModelScope 而不用 HuggingFace

这算是个面向大陆地区用户的决定。HuggingFace 访问不稳定,ModelScope 是阿里的平台,下载速度快,Qwen 系列模型也在上面有。搜索的时候会遍历上面的 GGUF。

完整命令列表

openlaoke model download [model_id]   # 下载模型
openlaoke model list                   # 列出所有模型
openlaoke model search <关键词>         # 搜索 ModelScope
openlaoke model remove <model_id>      # 删除模型
openlaoke model info <model_id>        # 查看模型详情

交互界面里:

  • Ctrl+P:模型选择器
  • /model:查看或切换模型
  • /model local_builtin/qwen3:0.6b:直接切到本地模型
  • /localconfig:调整本地模型参数

说点实话

小模型嘛,能力肯定比不上 Claude、Qwen3.6-Flash 等等这些在线的模型,能写个简单的函数就不错了,复杂逻辑它确实搞不定。

但是,有些场景就够了。比如就想让 AI 帮我补个函数名,写个简单的正则,或者问个 Python 的语法问题,这种事不用花 API 费,本地的就够用。

还有一个好处就是隐私。代码不出本机,不经过任何服务器,对一些涉密项目来说这很重要。

以后如果硬件条件好了,换个大点的模型跑就行了,命令都一样,模型文件换一下就好。这东西嘛,好歹能用。

对了,量化版本别选太低的。IQ2_XXS 这种 2bit 的,质量损失严重,建议至少选 Q4_K_M 或者 Q5_K_M,效果好不少。

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

虚拟化,操作系统,以及一些小工具 · 目录

虚拟化,操作系统,以及一些小工具

上一篇修了TransPaste的4个bug下一篇自用的OpenCode Skill再次更新:22个skills重新打磨了一遍,顺路解决了OpenCode导致整个图形界面崩溃的问题

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%