↩ 研究与项目/OpenAI 方法论 Primer

01 · 向量检索与分类聚类 Primer

The OpenAI Methods Primer · 01

Cookbook 嵌入式(embeddings)全家桶:Classification using embeddings / Clustering / Embedding Wikipedia articles for search / Code search using embeddings / Clustering for transaction classification——「语义作为坐标系」的工程学。


一句话定位

把文本变成向量之后,NLP 的多数任务变成几何题:相似度是距离、分类是找邻居、聚类是分堆、检索是最近邻——四个 notebook 各讲一种几何用法。

四道菜精要

Classification using embeddings · 嵌入式分类

Clustering · 聚类

Clustering for transaction classification · 交易聚类

Embedding Wikipedia articles / Code search · 两个检索

方法论精华

1. 「分块是长文档检索的第一设计变量」:维基示例的核心不在模型在切法——块太大语义稀释、太小上下文丢失;检索质量 = 分块策略 × 嵌入质量,前者常被忽视。

2. 零训练分类的适用边界:嵌入式分类不需要训练数据但要每个标签有代表性样例;标签语义区分度高时它是最快路径,区分度低时还是得上微调(见 06)。

3. 聚类是「先看形状」工具:对陌生语料先聚类再决定分类体系——让数据提出假设,人验证假设(与统计课的 EDA 一脉)。

4. 代码检索 = 开发者的第二记忆:函数级语义索引让「我记得写过类似的东西」变成可查询的事。

编者注

这组 notebook 是 RAG 时代的地基课。对照 Anthropic 侧:cowork 的 enterprise-search 把这些几何原语包成了产品(去重、置信度、冲突呈现)——原语到产品的距离就是那层信息综合纪律。

← 总览:OpenAI 方法论地图
构建 Agent Primer →