Cookbook 双菜:Developing hallucination guardrails(幻觉护栏开发)+ Custom LLM-as-a-Judge(用 LLM 当裁判检测幻觉)——如何系统性不信任自己的系统。
一句话定位
两条防线一条裁判:护栏在生成侧拦(检测输出是否无据)、裁判在评估侧判(用另一个模型对照证据打分)——幻觉治理从「祈祷」变成「工程」。
两道菜精要
Developing hallucination guardrails · 幻觉护栏
- 在应用里构建检测层:模型输出与源材料比对、无据陈述的识别与拦截
- 护栏的位置学:生成前(给材料)、生成中(约束)、生成后(验证)三段布防
Custom LLM-as-a-Judge · LLM 裁判
- 用 LLM 评估 LLM:裁判模型对照证据文档给生成打分(配合 Braintrust 平台示例)
- 自定义评分标准的设计:什么算幻觉、什么算合理推断、边界案例怎么标
- 裁判本身要校准:与人工标注对齐后才可信
方法论精华
1. 护栏的位置学:生成前给足材料(减少幻觉动机)、生成后强制验证(拦截漏网)——两头布防比中间祈祷有效;这与教程第八章四法(退出通道/给材料/先搜后答/隔离验证)是同一套拳的攻防两面。
2. LLM 裁判的三个纪律(与 Anthropic 评估课的模型评分互证):
- 评分标准要具体到可操作(「无据陈述=扣分」而非「质量差=扣分」)
- 裁判要对照证据打分不是凭感觉
- 裁判上线前要人工对齐校准
3. 「系统性不信任」作为设计姿态:两道菜的共同前提是「模型一定会幻觉,问题是怎么兜住」——信任是设计出来的不是训练出来的。
编者注
这两道菜是证据台哲学的技术底座:护栏 ≈ 抽取时「缺证据留空」,裁判 ≈ 交付前验证的三档置信评级。医疗域的 span 级出处则是两者在生产环境的极限形态。幻觉治理的终局不是消灭幻觉,是让每个论断可检验。