两讲合一:openai/evals(20k★,评估框架与 registry)——LLM 评估的框架化;openai/swarm(22k★,教育性多智能体框架)——handoff(交接)模式的原点与它向 Agents SDK 的演化。
第一讲 · evals:评估的框架化
定位:评估 LLM 与 LLM 系统的框架——现成 registry(按维度测模型)+ 自建 eval(你的工作流模式)+ 私有 eval(数据不出域)。现在也可直接在 OpenAI Dashboard 配置运行。
框架要点:
- eval 注册表用 Git-LFS 存数据——评估数据与代码同版本管理
- 自建 eval 从克隆仓库起步(
pip install -e .即改即生效) - Greg Brockman 的开篇引语点题:「创建高质量 eval 是你能做的最高杠杆的事之一——没有 eval,模型版本变化对你的影响是黑盒」
第二讲 · swarm:handoff 模式的原点
定位:实验性、教育性的多智能体编排框架——核心抽象只有两个:Agent(指令+工具)与 handoff(交接)——agent A 在函数里 return agent_b 就把对话交接给 B。
README 的诚实:已被生产级的 OpenAI Agents SDK 取代,官方建议迁移——教育框架的宿命是教会世界然后退场。
handoff 的遗产:
- 多智能体的最小机制不是「总线」不是「黑板」,是函数返回即交接——简单到可以用三个例子讲清
- Agents SDK 继承并生产化:handoffs、guardrails、tracing——先有概念教学,后有产品
- 对照 symphony 的看板驱动编排:swarm 是对话内交接,symphony 是工作项间派发——粒度差三个数量级,各有其位
方法论精华
1. 评估三形态的版权观:公开 registry(可复用基准)、自建(你的模式)、私有(数据不出域)——评估资产的敏感度分级从框架层就设计好。
2. 教育框架的价值在概念密度:swarm 用最小可运行代码讲清 handoff——最好的教学框架以「被自己取代」为成功标准(对照 Anthropic 的 launch-your-agent 自称「教学实现,更费 token」)。
3. 演化史本身是方法论:swarm(概念)→ Agents SDK(产品)→ symphony(组织)——多智能体的三级跳:机制、框架、编排骨架;每一级解决上一级暴露的问题。
编者按
两讲合读是一个完整判断:评估决定单agent 的质量上限,编排决定多agent 的组织上限——OpenAI 把两边都开成了公开课。至此 OpenAI 方法论九篇收束,与 Anthropic 十六篇对照,两家的全部公开智慧都已在你的图书馆里。