Embedding 与相似度:语义坐标系
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 2 · RAG 与数据 · 第 11/43 篇 · 🚧 占位待学
上一篇:《上下文耗尽与压缩:长对话的续命术》
下一篇:《Chunking 策略:文档切法的学问》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 2 · 单元 2.1
一、本文要解决的问题
怎么让机器知道「退款」和「退货退钱」是一回事?embedding 把文字变成向量,「意思近 = 距离近」。这是检索增强的地基。
二、知识点清单
- embedding 模型:输入文本、输出定长向量
- 余弦相似度与语义距离的直觉
- 关键词匹配(BM25)vs 语义检索:各自擅长与翻车场景
- 嵌入模型的维度、最大长度与选型
三、动手实验(学习时必须真跑)
- 对一组近义 / 反义 / 无关句子调 embedding API 算余弦相似度,验证「语义坐标」
- 构造一个 BM25 查不到、向量能查到的查询(同义改写),再构造一个反例(专有名词、编号)
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。