Cookbook:Fine-tuning techniques —— Choosing Between SFT, DPO, and RFT(含 DPO 指南)——什么时候微调、选哪种微调的决策课;配 Fine-tuning for function calling / Fine-tuned classification 两道落地菜。
一句话定位
微调的选型学:监督微调(SFT)、直接偏好优化(DPO)、强化微调(RFT)三条路线各有其时——先判断你的问题类型,再选刀;多数「想微调」的场景其实该先试提示工程与少样本。
三条路线精要
SFT · 监督微调
- 有大量「输入→理想输出」对时:格式迁移、风格锁定、领域注入
- 最朴素也最稳:分类微调(Fine-tuned classification 菜)就是它的标准应用——当嵌入式分类(01)的标签区分度不够时,SFT 顶上
DPO · 直接偏好优化
- 有「偏好对」(同一输入下 A 好于 B)时:对齐输出风格与取舍
- 无需训练奖励模型的 RLHF 简化路线——「我不喜欢这样回答」本身是可用的训练信号
RFT · 强化微调
- 有可验证的成功标准时(代码过测试、数学答案对错):让模型在任务奖励上自我改进
- 前提最苛刻、天花板最高——奖励可验证的领域(代码/数学)才适用
方法论精华
1. 选型的阶梯:提示工程 → 少样本 → RAG → 微调——每上一级成本一个数量级,先穷尽下一级。微调解决的是「行为内化」问题(延迟、成本、一致性),不是「知识」问题(知识用 RAG)。
2. 「可验证性」决定上限:RFT 的存在证明——哪里有客观对错,模型就能自我超越;这与编码 agent「执行即验证」(02)、symphony 的「工作证明」(07)是同一哲学的三次出现。
3. 数据形态决定路线:理想输出对→SFT、偏好对→DPO、验证器→RFT——先盘点你手里有什么形状的数据,路线自己会浮出来。
编者注
这门课的隐藏价值是「反微调劝退学」:多数团队高估微调的必要、低估提示与检索的上限。对本站读者:投研场景里「格式一致的财报抽取」可 SFT,「分析口吻的偏好」可 DPO,「策略回测对错」理论上可 RFT——但先把证据台的规则路走穿。