↩ 研究与项目/Agent Skills 官方技能 Primer

06 · oncall-kit:值班应急的自动分诊

The Agent Skills Official Primer · 06

anthropics/oncall-kit:把 Claude 放进事故频道——告警响起时它调查并贴出每个论断后面带链接的初诊;人决定怎么办;Claude 盯着修复落地并写下经验,让下一次事故起点更高。配套博客《AI CI/CD on-call》的参考实现。


一句话定位

值班循环的四个环节自动化三个半:告警→Claude 调查→人决策→Claode 盯修复与沉淀——设计哲学是「机器初诊、人类决断、经验回流」。

两条设计原则(README 开篇即讲)

1. 工具无关:技能里不写厂商名,只写能力——metrics source、log store、pager、code host;一个生成的 STACK.md 把能力映射到你们频道实际连的工具。Datadog 换 Grafana、PagerDuty 换 Opsgenie,技能一个字不改。

2. Playbook 不是从零写的:setup 读你们团队的真实事故史——告警线程、pager 历史、postmortem——从你们实际做过的事里起草 playbook,你审你改。

十分钟试用

零连接零管理:克隆仓库、Claude Code 打开、贴 test-factories/RUNBOOK.md 的一行指令——对一支虚构团队的 48 起事故史跑完整流程:挖掘、playbook 起草、签核闸、分级演练。

方法论精华

1. 「每个论断后面带链接」——初诊的可信度设计:事故频道里最危险的是「听起来对的错误诊断」;链接是让人类决策者能验证的唯一手段。与证据台、财报点评的引用强制一脉相承——这条纪律已是 Anthropic 全产品线的肌肉记忆。

2. STACK.md 的能力抽象层:把「工具名」与「能力」解耦——这是对 MCP 生态「类别占位符」(~~chat、~~pager)的文件级实现。依赖能力而非实现,是可移植性的全部秘密。

3. 事故史即训练数据:playbook 从自己团队的 48 起事故里挖——比任何通用模板都准,因为每支团队的故障模式都是特有的。

4. 签核闸(sign-off gates):起草的 playbook 要人签核才生效——又一次「机器起草、人类批准」。

编者按

oncall-kit 是「AI 进团队工作流」的正确姿势标本:不抢决策权(人决定怎么办)、拿走苦活(初诊调查)、沉淀组织记忆(每次事故的教训回流 playbook)。对任何有 oncall 的团队,这个循环值得照抄。

← launch-your-agent:从想法到上线托管代理
defending-code:代码安全防御 →