先教会再让它做——大模型定制化里CPT和SFT到底在干什么

咱们今天聊个大模型落地时绕不开的两个东西:CPT和SFT。

你可能听说过,大模型很厉害,什么都能聊两句。但真要把它放到医院、法院、银行里用,就发现它啥也干不像是那么回事。术语听不懂,格式不会写,回答起来跟外行似的。

为啥呢?因为它虽然博览群书,但它那点书里头,专业领域的占比太低了。

那咋整?两条路:先补知识,再教规矩。补知识叫CPT,教规矩叫SFT。

CPT:让模型"读进去"专业知识

CPT的全称是Continued Pre-Training,翻译过来就是"持续预训练"或者"续训"。

说白了,就是拿一大堆专业的文章——医学论文、法律条文、金融报告——继续让模型"读"。注意,这里的"读"是加引号的,模型并不是真的在理解,它做的事跟预训练阶段一模一样:猜下一个词。只不过这次给它读的,全是某个领域的专业文本。

Image

2020年发在ACL上的一篇论文叫"Don't Stop Pretraining",这文章做了一件很漂亮的事:在四个领域(生物医学、计算机科学、新闻、评论)上做实验,发现不管你是大数据集还是小数据集,在通用模型上续训一遍领域文本,效果都有明显提升。如果你续训完领域文本之后,再拿具体任务的数据续训一遍,还能再涨一截 [1]。这篇文章算是给CPT的理论基础钉了一颗很结实的钉子。

后来很多工作都验证了这一点。比如中医大模型Zhongjing就做了消融实验:只用SFT不CPT,模型虽然能跟着指令走,但医学知识明显不够用;加了CPT,知识就补上来了 [3]。再比如SOAEsV2的实验,领域预训练之后通用能力只掉了0.2%,但领域指标涨了8%到17%,这买卖划算 [6]。

CPT的数据要求很简单:要多,但不需要标注。几百万Token的专业文本,往里一灌就行。Baichuan4-Finance在金融领域用了它所谓的"领域自约束"策略,核心思路就是动态调配领域数据和通用数据的比例,别让模型读太多专业文本把通用能力给忘了 [5]。这个"别忘了通用能力"的事,是CPT最头疼的问题,学术上叫灾难性遗忘。

怎么对抗灾难性遗忘?几条路:一条是数据混合,在专业文本里混一点原来训练用的通用文本,EstLLM做爱沙尼亚语的续训就是这么干的 [7];另一条是训练完再把领域模型和通用模型合并,法国那边做生物医学DAPT的研究发现这么合并有时反而还能涨专业指标 [8]。

SFT:让模型"会干活"

光让模型读了专业书还不够。一个读了医学教科书的高材生,让他直接上临床,他也不知道该怎么跟患者说话、病历格式是啥样的。这时候需要SFT。

SFT的全称是Supervised Fine-Tuning,监督微调。它干的事跟CPT很不一样:CPT是让模型自由阅读,SFT是手把手教模型怎么做事。你给模型一堆"问-答"对,它照着学。

Image

举个例子,你给模型看:"问:将以下英文摘要翻译为中文"、"答:(对应翻译)"。模型学会了这种指令-回答的模式,下次碰到类似指令就能照做了。但这跟传统的NLP微调不一样——传统微调是让模型学一个特定任务(比如分情感),SFT是让模型学会"听懂指令"这件事本身。

Image

2022年Wei等人做的FLAN实验很好地证明了这一点:拿60多个任务做指令格式化微调,模型在没见过的任务上居然也变好了,25个任务里20个超过了175B的GPT-3 [9]。这说明SFT教的不是具体任务,而是"怎么听人话"这个元能力。同年Ouyang等人的InstructGPT更直接:1.3B参数的模型,经过SFT+RLHF之后,人类评分居然能赢175B的原始GPT-3 [10]。对齐比堆参数值钱。

SFT的数据特征跟CPT几乎完全反过来:要精,不要多。Zhongjing用了7万条真实的医患对话 [3],PediatricsGPT搞了30万条多任务指令 [11],听起来不少,但跟CPT那几百万Token比,只是个零头。质量比数量重要得多,SciLitLLM的研究就强调过,在科学领域做SFT,最头疼的就是指令数据怎么搞够多样、够好 [2]。

Image

SFT也有自己的坑。一是幻觉:Kaplan等人的研究指出,SFT在教模型新知识的同时可能让模型更爱胡编,因为这会干扰模型原本已经学会的知识 [12]。二是遗忘:Lyu等人发现,SFT做狠了,模型反而会把之前学会的指令跟随能力给忘了 [13]。三是模式坍缩:Chen等人说标准SFT训练会让模型的回答变得千篇一律,后续想做RL都难 [14]。

Image

这俩搭在一起才完整

CPT和SFT不是二选一,而是必须搭配。SciLitLLM的那句话总结得很到位:CPT解决"缺乏领域知识",SFT解决"不熟悉专业任务" [2]。一个管懂不懂,一个管会不会。

打个比方:CPT就像送一个特长生去医学院读4+4的医学博士,读完他什么术语都知道了,但见着病人可能还张不开嘴。SFT就像临床实习,在带教老师手底下学怎么问诊、怎么写病历。两种经历缺一不可。

Image

实践中也确实是这么干的。从中医大模型到金融大模型,从法律大模型到科学文献理解模型,几乎全是"CPT → SFT → 对齐"的套路。Rahman等人的消融实验把这事说得更透:单独SFT是模型泛化的必要条件,单独CPT放大这个泛化效果,但只有两者结合,模型才能在弱监督条件下也稳住 [17]。

SOAEsV2还做了一个有意思的事:他们搞了"领域渐进式SFT",不是一股脑把所有专业指令甩给模型,而是先给弱相关的对话数据,再给专家标注的专业数据 [6]。这跟健身似的,热身再来大重量,效果比上来就猛干要好。

CPT到底还值不值?

这是个最近挺多人吵的问题。通用模型越来越强了,再花大力气做CPT,收益是不是在变小?

确实有研究在泼冷水。法语生物医学领域有人做实验,发现DAPT之后某些场景下并不比通用模型好多少 [8]。英语临床任务上,专门的医学LLM也没稳定赢过通用模型 [18]。

但我觉得这不一定说明CPT没用了,更可能说明咱们目前的评测方法不够好,量不出真正的"专业性"。而且在低资源语言、特别窄的子领域里,CPT的作用还是很明显的 [7][8]。

SFT之后还能干啥?

SFT不是终点。现在完整的流水线通常是"SFT → RLHF/DPO → 迭代优化"。SFT打了地基,后面才能盖楼。但SFT本身怎么做得更好、怎么保留更多多样性给后面的RL用,还是个很热的研究方向 [14]。

Image

另外还有一条路是RAG(检索增强生成),它不往模型脑子里灌知识,而是需要的时候从外部知识库去查。Klila等人在生物医学领域对比了CPT和GraphRAG,发现两者其实是互补的:CPT把知识变成模型的内部记忆,查起来快但更新难;RAG是现查现用,更新方便但要慢一步 [19]。所以现在越来越多人在做"CPT+RAG"的组合。

Image

最后

CPT让模型长知识,SFT让模型学规矩。先让它懂,再让它做——这就是大模型定制化的底层逻辑。


参考文献

[1] Gururangan et al. (2020). Don't Stop Pretraining: Adapt Language Models to Domains and Tasks. ACL 2020. arXiv:2004.10964.

[2] Li et al. (2025). SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding. ICLR 2025. arXiv:2408.15545.

[3] Yang et al. (2023). Zhongjing: Enhancing the Chinese Medical Capabilities of Large Language Model through Expert Feedback and Real-world Multi-turn Dialogue. arXiv:2308.03549.

[4] Ye et al. (2023). Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model. arXiv:2310.09089.

[5] Zhang et al. (2024). Baichuan4-Finance Technical Report. arXiv:2412.15270.

[6] Deng et al. (2025). SOAEsV2-7B/72B: Full-Pipeline Optimization for State-Owned Enterprise LLMs. arXiv:2505.04723.

[7] Dorkin et al. (2026). EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs. arXiv:2603.02041.

[8] Mannion et al. (2026). Is Biomedical Specialization Still Worth It? arXiv:2604.06903.

[9] Wei et al. (2022). Finetuned Language Models Are Zero-Shot Learners. ICLR 2022. arXiv:2109.01652.

[10] Ouyang et al. (2022). Training Language Models to Follow Instructions with Human Feedback. NeurIPS 2022. arXiv:2203.02155.

[11] Yang et al. (2024). PediatricsGPT: Large Language Models as Chinese Medical Assistants for Pediatric Applications. NeurIPS 2024. arXiv:2405.19266.

[12] Kaplan et al. (2026). Why Fine-Tuning Encourages Hallucinations and How to Fix It. arXiv:2604.15574.

[13] Lyu et al. (2026). Countering Catastrophic Forgetting via Weight-Space Model Merging. arXiv:2604.01538.

[14] Chen et al. (2026). SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning. arXiv:2602.07464.

[15] Huang et al. (2026). PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs. arXiv:2604.17543.

[16] Wu et al. (2026). WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report. arXiv:2604.06737.

[17] Rahman et al. (2026). When Can LLMs Learn to Reason with Weak Supervision? arXiv:2604.18574.

[18] Domingo-Aldama et al. (2026). To Adapt or not to Adapt, Rethinking the Value of Medical Knowledge-Aware Large Language Models. arXiv:2604.06854.

[19] Klila et al. (2026). Injecting Structured Biomedical Knowledge into Language Models: Continual Pretraining vs. GraphRAG. LREC 2026. arXiv:2604.16422.

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇️ 从矿工到战略家:大模型技术的兵法演进录下一篇MoXing 速度最高达到 Ollama的 201% ,同模型同硬件的实测对比OmniCoder-2-9B 的 Q4_K_M 量化模型

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%