Liao(聊)-让本地大语言模型 AI 帮你聊天的开源工具

你有没有过这样的经历:工作忙得焦头烂额,消息响个不停,回也不是不回也不是。或者有时候就是懒得打字,但又不想让朋友觉得被冷落。

最近折腾了一个有意思的小工具,叫「聊」(Liao),可以让大语言模型帮你自动回复消息。不是那种傻乎乎的固定回复,而是真的能看懂对话内容,根据上下文生成回复的那种。

项目地址:https://github.com/cycleuser/Liao

这玩意儿怎么工作的?

原理其实不复杂:截图 → OCR 识别文字 → 扔给大模型生成回复 → 模拟键盘输入发送。

听起来简单,但要做到好用还是费了不少功夫。比如怎么准确识别哪些是对方发的、哪些是自己发的;怎么知道该什么时候回复(总不能对方还没说完就抢话);还有输入法切换、窗口焦点这些琐碎但烦人的问题。

Image

Image

为什么不直接调接口?

因为没有。

有的软件没有开放个人聊天的 API,第三方接口要么收费要么有封号风险。

「聊」走的是纯视觉路线——它不关心你用的是什么软件,只要是个聊天窗口就行。这样既不违反任何服务条款,也不用担心账号安全问题。

能用什么模型?

这是我比较喜欢的一点:支持本地部署的 Ollama,也支持 OpenAI、Claude 这些云端 API,甚至任何兼容 OpenAI 格式的接口都能用。

如果你担心隐私(毕竟是聊天记录),可以完全在本地跑。装个 Ollama,下载个小模型,所有数据都不出你的电脑。

云端模型当然更聪明,但要看你对隐私的敏感程度了。


手把手教你安装

说了这么多,来点实际的。安装过程根据系统不同会有些差异,我尽量写清楚。

前置条件

首先你得有 Python,版本 3.12 以上就行。现在大多数人电脑上应该都有。

然后你需要一个 LLM 后端,以下任选其一:

  • Ollama(推荐):本地运行,隐私有保障,去 https://ollama.ai/ 下载安装
  • OpenAI API:需要 API Key,按量付费
  • Claude API:Anthropic 家的,也需要 Key
  • 其他兼容接口:比如各种国产大模型的 API,只要兼容 OpenAI 格式就行

Windows 安装

Windows 用户最省心,一行命令搞定:

pip install liao[ocr]

这个 [ocr] 会自动装上文字识别需要的库。如果你网络环境不好装不上,也可以先装基础版:

pip install liao

然后单独装 OCR 引擎(后面会说怎么选)。

想从源码装也行:

git clone https://github.com/cycleuser/Liao.git
cd Liao
pip install -r requirements.txt

Linux 安装

Linux 稍微麻烦一点,需要先装几个系统包。这些主要是给输入模拟和截图用的:

sudo apt install xdotool wl-clipboard xclip tesseract-ocr tesseract-ocr-chi-sim gnome-screenshot

如果你用的是 Wayland 桌面(现在 Ubuntu 默认就是),还需要这些:

sudo apt install gstreamer1.0-plugins-good pipewire python3-gi python3-dbus

系统包装好之后,再装 Python 包:

pip install liao

或者从源码:

git clone https://github.com/cycleuser/Liao.git
cd Liao
pip install -r requirements-linux.txt

有个好消息是,虽然 Linux 现在普遍用 Wayland,但微信这些聊天软件大多还是跑在 XWayland 兼容层上,所以 xdotool 还是能用的。

OCR 引擎怎么选?

「聊」支持三种 OCR 引擎,至少装一个:

引擎 安装命令 特点
EasyOCR pip install easyocr 最准,但要下载 PyTorch,体积大(约 2GB)
RapidOCR pip install rapidocr-onnxruntime 轻量快速,但不支持 Python 3.13
pytesseract pip install pytesseract 通用方案,需要额外装 tesseract 程序

个人建议:如果硬盘空间够、网络也还行,就装 EasyOCR,识别效果最好。要是想轻量一点,RapidOCR 也不错。


实际使用流程

装好之后,命令行敲 liao 就能启动图形界面。下面一步步说怎么用。

第一步:连接 LLM

打开程序,首先要配置 LLM 连接。

启动界面

启动界面

界面上需要填两个东西:

  • API 地址:Ollama 本地的话填 http://localhost:11434,云端 API 就填对应的接口地址,也可以用局域网的地址。
  • 模型名称:比如 gemma3qwen3 这些

如果用 OpenAI 或 Claude,还需要填 API Key。

第二步:设置语言(可选)

界面默认是英文的,可以在右上角切换成中文。

语言设置

语言设置

这个随便你,功能都一样。

第三步:选择模型

连上 LLM 服务之后,点「刷新模型列表」,会列出所有可用的模型。

选一个你喜欢的。

选择模型

选择模型

小模型响应快但可能不够聪明,大模型更靠谱但吃资源。根据自己电脑配置来选吧。

第四步:选择目标窗口

切到「窗口选择」页面,点「刷新窗口列表」,会列出当前打开的所有程序窗口。

选择窗口

选择窗口

找到你要自动回复的聊天窗口,双击选中它。程序会自动检测这是不是聊天类应用。

第五步:设置聊天区域

这一步是告诉程序「哪里是聊天内容」和「哪里是输入框」。

设置区域

设置区域

点「截图并检测」,程序会自动识别。

大多数情况下自动检测就够用了。

如果检测不准,也可以手动框选区域。

界面上有可视化的覆盖层,让你精确指定聊天区域、输入框位置、还有发送按钮的位置。

第六步:开始自动对话

最后一步,设置一下 AI 的「人设」。

开始对话

开始对话

在提示词框里写上你希望 AI 怎么聊天,比如:

  • 「热情友好,喜欢用表情」
  • 「惜字如金,回复简短」
  • 「专业严谨,像个客服」

然后设置对话轮数。可以设固定次数(比如 10 轮),也可以勾上「无限制」让它一直聊下去。

点「开始自动对话」,程序就开始工作了。它会:

  1. 监控聊天窗口
  2. 识别对方发来的新消息
  3. 根据上下文生成回复
  4. 自动输入并发送

你可以在界面上实时看到对话内容和日志,随时可以点「停止」暂停。


靠谱吗?会不会翻车?

说实话,目前更适合不太正式的场景。

跟朋友瞎聊、群里水群这种没问题。重要的工作对话还是自己来吧。

OCR 偶尔会认错字,模型有时候也会说些奇怪的话。

工具提供了日志功能,发送之前可以看看 AI 生成了什么,不满意随时停下来。

另外程序有个「回复门控」机制——只有检测到对方发了新消息,才会生成回复。不会出现自说自话的尴尬场面。

常见问题

装好之后可能会遇到一些小问题,这里列几个常见的:

Windows:

  • 提示「pywin32 not found」:运行 pip install pywin32,然后重启 Python
  • 截图失败:某些受保护的窗口需要管理员权限

Linux:

  • 提示「xdotool not found」:运行 sudo apt install xdotool
  • 输入不生效:确保目标窗口是 X11 或 XWayland 窗口
  • Wayland 截图失败:需要装 GStreamer 和 PipeWire 相关包,授权时同意屏幕捕获
  • OCR 返回空:装一下 OCR 引擎,推荐 pip install easyocr

最后

这工具适合什么人?大概是那些既想保持社交又懒得打字的开发人员吧(比如我)。

当然,真正重要的对话还是要亲自参与。AI 再聪明,也替代不了真实的人际交流。

但如果只是想在摸鱼的时候维持一下「在线」的假象……这个工具还挺好使的。

代码开源在 GitHub:https://github.com/cycleuser/Liao

采用 GPL v3 协议,欢迎 Star 和 PR。

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

虚拟化,操作系统,以及一些小工具 · 目录

虚拟化,操作系统,以及一些小工具

上一篇Chou(瞅)——一个Python小工具,让你的论文PDF文件名不再是乱码下一篇VidToGif-一个简单高效的视频转 GIF 工具

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%