Cookbook 嵌入式(embeddings)全家桶:Classification using embeddings / Clustering / Embedding Wikipedia articles for search / Code search using embeddings / Clustering for transaction classification——「语义作为坐标系」的工程学。
一句话定位
把文本变成向量之后,NLP 的多数任务变成几何题:相似度是距离、分类是找邻居、聚类是分堆、检索是最近邻——四个 notebook 各讲一种几何用法。
四道菜精要
Classification using embeddings · 嵌入式分类
- 不微调模型:文本→embedding→在向量空间里按标签的邻近度分类
- 零训练成本的分类路线;标签可以随时增删——分类器的柔性来自几何而非参数
Clustering · 聚类
- 无标签发现结构:k-means 一族在嵌入空间分堆
- 典型用法:用户反馈自动分组——先聚类看形状,再人工命名
Clustering for transaction classification · 交易聚类
- 聚类的金融落地:交易流水自动分组发现消费模式——几何方法对半结构化短文本特别好使
Embedding Wikipedia articles / Code search · 两个检索
- 维基百科文章检索:长文档分块→逐块嵌入→查询最近邻——RAG 的最小心跳版本
- 代码搜索:函数级嵌入,自然语言查代码——代码的语义索引
方法论精华
1. 「分块是长文档检索的第一设计变量」:维基示例的核心不在模型在切法——块太大语义稀释、太小上下文丢失;检索质量 = 分块策略 × 嵌入质量,前者常被忽视。
2. 零训练分类的适用边界:嵌入式分类不需要训练数据但要每个标签有代表性样例;标签语义区分度高时它是最快路径,区分度低时还是得上微调(见 06)。
3. 聚类是「先看形状」工具:对陌生语料先聚类再决定分类体系——让数据提出假设,人验证假设(与统计课的 EDA 一脉)。
4. 代码检索 = 开发者的第二记忆:函数级语义索引让「我记得写过类似的东西」变成可查询的事。
编者注
这组 notebook 是 RAG 时代的地基课。对照 Anthropic 侧:cowork 的 enterprise-search 把这些几何原语包成了产品(去重、置信度、冲突呈现)——原语到产品的距离就是那层信息综合纪律。