↩ 研究与项目/OpenAI 方法论 Primer

06 · 微调选型 Primer

The OpenAI Methods Primer · 06

Cookbook:Fine-tuning techniques —— Choosing Between SFT, DPO, and RFT(含 DPO 指南)——什么时候微调、选哪种微调的决策课;配 Fine-tuning for function calling / Fine-tuned classification 两道落地菜。


一句话定位

微调的选型学:监督微调(SFT)、直接偏好优化(DPO)、强化微调(RFT)三条路线各有其时——先判断你的问题类型,再选刀;多数「想微调」的场景其实该先试提示工程与少样本。

三条路线精要

SFT · 监督微调

DPO · 直接偏好优化

RFT · 强化微调

方法论精华

1. 选型的阶梯:提示工程 → 少样本 → RAG → 微调——每上一级成本一个数量级,先穷尽下一级。微调解决的是「行为内化」问题(延迟、成本、一致性),不是「知识」问题(知识用 RAG)。

2. 「可验证性」决定上限:RFT 的存在证明——哪里有客观对错,模型就能自我超越;这与编码 agent「执行即验证」(02)、symphony 的「工作证明」(07)是同一哲学的三次出现。

3. 数据形态决定路线:理想输出对→SFT、偏好对→DPO、验证器→RFT——先盘点你手里有什么形状的数据,路线自己会浮出来。

编者注

这门课的隐藏价值是「反微调劝退学」:多数团队高估微调的必要、低估提示与检索的上限。对本站读者:投研场景里「格式一致的财报抽取」可 SFT,「分析口吻的偏好」可 DPO,「策略回测对错」理论上可 RFT——但先把证据台的规则路走穿。

← Meta-prompting Primer
symphony 与 harness engineering Primer →