先说清楚,这篇文章不是讲相声艺术的。我对相声毫不理解,完全不懂,也很少接触。传统相声里的贯口、柳活、腿子活这些门道,我一个都说不明白。
那为什么拿相声当例子?因为我想演示一个看起来和 AI、数据科学、计算机离得非常远的场景,其实也能用上这些工具。不需要提示词工程的高手,也不懂什么技能工程、Agent 编排这些名词,在一个看上去很不相干的行业场景,也能实现一件事:把一件想做的事,用大白话说清楚,然后让智能体去办。 这大概是智能体最朴素的用法了。
我儿子最近喜欢听相声
先说清楚这事的由头。不是我自己要收集相声——是我儿子最近听相声,之前我媳妇给他讲历史故事的时候已经找了很多文本,那这次我想给我儿子找一些相声文本来了解内容。借着这个机会,帮他建立一份初步整理好的东西。
所以我的需求很直接:把网上能找到的相声文本,收拢到一个目录里,一个段子一个文件,每个文件带上标注,从网络上搜索所有能找到的段子。就这么一句话。

我给 opencode 的完整提示词是这样:
建立一个专门的相声文本的目录,把历史上所有的经典的古典相声段子,小段大活儿等等按照一个一个文件来放好,并且做好标注。从网络上搜索所有能找到的相声段子来吧
提示词隐含策略和框架
你可能觉得,这句话挺含糊的,什么"所有""经典""做好标注",全是虚的。但它接到这句话之后,并没有直接冲出去乱搜,而是先干了一件事——按我话里蕴含的思路,先把架子搭起来。
我说"建一个目录""按文件放好""做好标注",它就能听出这活儿得有个结构。于是它先建了这么个骨架:
相声文本库/
├── README.md
├── 《传统相声汇集》总目录.md
├── 《中国传统相声大全》目录.md
├── 传统单口相声/
├── 传统对口相声/
├── 传统群口相声/
└── 新相声/
凡事都是要有结构,有纲要,有目录,这就是一个体现。拿了这个,他再去找,这就叫按图索骥,它去参考着找。
最开始,它从网上翻到了《传统相声汇集》的完整目录——这套书俗称"六小本儿",六册收了二百多段传统相声,每段还标了口述者和整理者,张寿臣、刘宝瑞、郭启儒、侯宝林、马三立、常宝堃这些名字都在上面。这份目录就成了整个库的索引地基,后面一段一段往里填,就照着它来。
这里其实是个挺重要的点:虽然我是直接给它提了个要求,但要求里边尽量蕴含一点对这件事的思考。 这个提示词其实压根也说不上什么提示词工程,只是对话的人默认脑子里就想到了要分类、要标注、要完整。把这些想法用大白话放进要求里,智能体就能沿着这个思路去执行。所谓的提示词工程也不是什么玄学,而更可以说是「沟通的技术」,是要求里带上你的思考方向,它才知道往哪儿使劲。
顺着名字一路挖下去
架子搭好,就开始填内容了。搜到一批经典段子之后,目录里就有了很多段子的名字。有意思的是,它拿着这些名字,还能接着搜出更多东西,就是从搜索结果当中发散出更多线索。
比如从目录里看到《报菜名》《八扇屏》《地理图》,它就能顺着这些名字去找各自的全本;看到表演者名单里有张寿臣、刘宝瑞,它又能顺着人去找他们名下别的段子。名字是锚点,一个带一个,越挖越多。
人自己查这些相关的事儿的时候,是不是不也是这样?如果有的时候需要咱们自己找这种线索,也都是会先看看著名的作品,是谁的代表作,再找典型作者,然后这么来。跟智能体交流也是类似,把事儿说清楚,剩下让它自己滚雪球。
AI替人干那些无聊的活
这里得再次强调一个原则,让 AI 干活,建议只让它替人完成无聊的重复的机械内容,而绝对不建议把判断权也交给它。
比如这次,它要上网去把一堆页面上的文本拿下来。这事儿的本质是什么?是让它去操作浏览器、上网帮忙下载东西,省去了人一个个复制粘贴的功夫。 ——它只是执行里那些重复、枯燥、纯粹浪费时间的部分。搜集和排版这种活,人干起来又慢又无聊,交给它正合适。
AI擅长替人做那些浪费时间又毫无乐趣的重复劳动。
遇到问题AI能自己想办法
这种从网上搜集文本的活儿,走一遍就一定会遇到几个坑,我一开始其实还担心它搞不定,后来发现它对这种问题处理得比人还顺。
第一个坑是文字编码。有的网站页面文字是 GBK 编码的,直接读出来全是乱码,得转成 UTF-8 才能正常显示。你要是让一个外行人来干这个,他可能压根不知道还有"编码"这么回事,看着满屏乱码就傻眼了。但模型智能体不会——它发现乱码,会自己去识别编码、转码、再重新读。对它来说这不算问题,自动就解决了。
第二个坑是内容不完整。很多段子在网上只有一半,正文中间有个"查看完整内容"的按钮,点进去要花钱。遇到这种,它就得四处换来源,从别的网站找完整版,再把缺的部分补上拼好。这个问题它也能尽量自己解决——这个站不全就换那个站,一遍不行换几遍。
智能体有一个特点:人觉得麻烦甚至无从下手的技术性问题,对模型来说往往不是问题,它会自己想办法。 你需要操心的不是"它会不会搞不定",而是"怎么把要求说清楚,让它知道去干嘛"。
就算不知道什么是字符编码,也不知道到哪里找和如何拼接完整,人也可以完全不担心不关注这些。
就像是我要炒菜,只需要知道锅怎么用,菜洗干净之后切成什么样,然后放多少盐就行了。
不需要去知道这个锅是用什么材料制作的,加工的工艺是什么样的,它的矿物来源是怎么样的,在哪儿进行的选矿冶炼,在哪儿进行的加工成型,怎么进行的互联网营销,最终通过什么样的快递到了这,这些都不用管。
也不用去知道这个菜是在什么地方产地种的,经历了多长时间的日照,用了什么样的肥料,最终怎么采摘,怎么保存,怎么发给我,这些都不是我一个做菜的这个场景下的操作人员所需要去关注的,人类社会的分工不就是这样吗?
初步的结果是一个几十万字的文本目录
折腾了一圈之后,目录就建成了。最终收进来了四十多个段子的完整文本,加起来二十多万字:
- 传统单口相声:珍珠翡翠白玉汤、连升三级、山东斗法、解学士、君臣斗、小神仙这些刘宝瑞、张寿臣的名段;
- 传统对口相声:贯口的报菜名、八扇屏、地理图、绕口令,文哏的论捧逗、文章会,柳活的黄鹤楼、空城计、汾河湾,武哏的大保镖等等;
- 传统群口相声:扒马褂、训徒、金刚腿;
- 新相声:夜行记、买猴、钓鱼、宇宙牌香烟、五官争功、虎口遐想、小偷公司。

文本是原文基础上整理加工过的
拿到目录之后,可能有人会想:这不就是把网上的文本复制下来存好吗?
不完全是。每个文件里不只是原样文本,模型还会对它做整理和加工。 拿连升三级、报菜名这些段子来说,每个文件的开头都有一份标注,正文也有统一的排版和分节。
比如报菜名那个文件,开头是这样的:
---
篇名: 《报菜名》
别名: 《菜单子》
类型: 传统对口相声 / 贯口活
性质: 大活儿
表演者: 郭启儒、马三立、常宝堃等,各家均有演出本
来源: 网络流传文本(yuwenmi.com 台词库)
整理时间: 2026-08-06
---
正文里,角色对话统一用「甲:」「乙:」标出来,单口的用叙述体,群口的用「甲/乙/丙」。文末还有一节"来源与备注",记着这段是从哪抓的、什么版本、有什么残缺。拿到的文本,模型还会顺手润色一下,让它更通顺、更完整,读起来像是整理好的定稿,而不是网页上黏下来的碎渣。

这一步的意义在于:从"一堆来源不明的网页"到"一份结构化的资料库",中间这个整理、标注、校对的活,原本要花很久,现在全让智能体替你干了。
这种整理好的东西能拿来干嘛
说到这儿,可能有人觉得,这不就是整理个资料吗?能有多大用。
其实想深一层,这种整理出来的结构化文本,用途可以比想象的大。比如,它可以直接作为某个场景的领域资料,拿去训练垂直领域的小模型、做微调的数据集、搭知识库。相声也好,别的什么也好,只要同类文本攒得够多、整理得够规范,就成了可以喂给模型的原料。
我要说的是:即使这事看起来和模型、和数据科学离得很远,也可以发挥一点想象力。 把日常生活里那些重复性比较高、又没什么创造性的任务,试着交给智能体——整理资料、下载文件、把零散的东西归拢成结构化的东西,这些都是它擅长的。你不用是程序员,也不用懂算法,你只要会"把一件事说清楚",就能使唤它。
但最后必须泼一盆冷水
讲到这里,我得提醒一句很重要的事,这也是做这种活儿一定要考虑到的:模型可能会有幻觉,这是难以避免的。
它给出来的文本里,可能带着它自己雕琢、甚至是扭曲的痕迹。你没法保证它整理的每一处都忠实于原文——有些地方它可能顺手"补全"了,有些地方可能理解错了。所以看到结果,不能全盘照收。
不过具体到相声这个东西,问题倒还不大。因为相声是语言的艺术,它讲究的是顺口、俏皮、包袱响。模型稍微给它改点词儿、顺点句子,人拿回来念两遍,觉得不对劲改回去就是了。语言这东西,改来改去损失不大。
但其他的学科可就未必了。 要是整理的是科学文献、医学资料、工程规范,模型要是来这么一手"润色",后果可能就严重了。所以最后一定要记住:不能轻信模型,不能让它替你做判断。 它负责把活干了,把东西摆到你面前,至于这些内容靠不靠谱、对不对,判断权永远得在你手里。