↩ 研究与项目/OpenAI 方法论 Primer

08 · 评估框架与多智能体演化史 Primer

The OpenAI Methods Primer · 08

两讲合一:openai/evals(20k★,评估框架与 registry)——LLM 评估的框架化;openai/swarm(22k★,教育性多智能体框架)——handoff(交接)模式的原点与它向 Agents SDK 的演化。


第一讲 · evals:评估的框架化

定位:评估 LLM 与 LLM 系统的框架——现成 registry(按维度测模型)+ 自建 eval(你的工作流模式)+ 私有 eval(数据不出域)。现在也可直接在 OpenAI Dashboard 配置运行。

框架要点:

第二讲 · swarm:handoff 模式的原点

定位:实验性、教育性的多智能体编排框架——核心抽象只有两个:Agent(指令+工具)与 handoff(交接)——agent A 在函数里 return agent_b 就把对话交接给 B。

README 的诚实:已被生产级的 OpenAI Agents SDK 取代,官方建议迁移——教育框架的宿命是教会世界然后退场。

handoff 的遗产:

方法论精华

1. 评估三形态的版权观:公开 registry(可复用基准)、自建(你的模式)、私有(数据不出域)——评估资产的敏感度分级从框架层就设计好。

2. 教育框架的价值在概念密度:swarm 用最小可运行代码讲清 handoff——最好的教学框架以「被自己取代」为成功标准(对照 Anthropic 的 launch-your-agent 自称「教学实现,更费 token」)。

3. 演化史本身是方法论:swarm(概念)→ Agents SDK(产品)→ symphony(组织)——多智能体的三级跳:机制、框架、编排骨架;每一级解决上一级暴露的问题。

编者按

两讲合读是一个完整判断:评估决定单agent 的质量上限,编排决定多agent 的组织上限——OpenAI 把两边都开成了公开课。至此 OpenAI 方法论九篇收束,与 Anthropic 十六篇对照,两家的全部公开智慧都已在你的图书馆里。

← symphony 与 harness engineering Primer