↩ 研究与项目/Prompt 工程五课 Primer

05 · Prompt 评估课 Primer

The Prompt Engineering Courses Primer · 05

courses 第四课 prompt_evaluations(9 单元):从评估引论、workbench 评估、代码评分、分类评估到 promptfoo 全家桶与自定义评分器——怎么证明一个提示是好的。


一句话定位

五课皇冠:没有评估的提示工程是玄学——这课给出从「肉眼看看」到「代码评分、模型评分、CI 集成」的完整评估阶梯。

九单元精要

基础三单元

分类评估

promptfoo 五连(05-09)

方法论精华

1. 评分器三型:代码评分(确定性,快而硬)、人工评分(金标准,贵而慢)、模型评分(规模化的近似)——生产评估体系是三型的组合,模型评分的可靠性本身要被评估。

2. 「评估先于优化」:没有评估基线,任何提示改动都无法证明变好——A/B 之争的裁判必须先于选手存在(与教程第九章「成功标准第一步」、launch-your-agent「按你的完成定义打分」一脉相承)。

3. 分类任务的混淆矩阵:不止看准确率——哪类错、错成什么比总对率信息量大(与 k12「干扰项即诊断」同一思想)。

编者按

这一课是「从爱好者到工程师」的分水岭,也是五课里最少人学的一门——因为它不教新魔法,教的是证明魔法有效的义务。对做任何 AI 产品的人:先读 01 和 08(模型评分的可信边界),能省掉将来一半的争论。

← 真实世界 Prompting Primer
工具使用课 Primer →