courses 第四课 prompt_evaluations(9 单元):从评估引论、workbench 评估、代码评分、分类评估到 promptfoo 全家桶与自定义评分器——怎么证明一个提示是好的。
一句话定位
五课皇冠:没有评估的提示工程是玄学——这课给出从「肉眼看看」到「代码评分、模型评分、CI 集成」的完整评估阶梯。
九单元精要
基础三单元
01 评估引论——为什么需要评估:直觉在提示改动面前系统性失灵02 workbench 评估——在开发环境里快速搭评估03 代码评分评估——用代码做确定性评分器:正则/结构/数值断言
分类评估
04 代码评分的分类评估——分类任务的准确率/混淆矩阵
promptfoo 五连(05-09)
- promptfoo 是开源提示评估框架,五单元覆盖:
- 代码评分动物示例 / 代码评分分类
- 自定义评分器(07)——业务特有的判定逻辑
- 模型评分(08)——用 LLM 判 LLM:何时可信、何时循环
- 自定义模型评分(09)——把评分 prompt 本身工程化
方法论精华
1. 评分器三型:代码评分(确定性,快而硬)、人工评分(金标准,贵而慢)、模型评分(规模化的近似)——生产评估体系是三型的组合,模型评分的可靠性本身要被评估。
2. 「评估先于优化」:没有评估基线,任何提示改动都无法证明变好——A/B 之争的裁判必须先于选手存在(与教程第九章「成功标准第一步」、launch-your-agent「按你的完成定义打分」一脉相承)。
3. 分类任务的混淆矩阵:不止看准确率——哪类错、错成什么比总对率信息量大(与 k12「干扰项即诊断」同一思想)。
编者按
这一课是「从爱好者到工程师」的分水岭,也是五课里最少人学的一门——因为它不教新魔法,教的是证明魔法有效的义务。对做任何 AI 产品的人:先读 01 和 08(模型评分的可信边界),能省掉将来一半的争论。