RAG 评估:没有评测集的调优是玄学
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 2 · RAG 与数据 · 第 14/43 篇 · 🚧 占位待学
上一篇:《混合检索与 Rerank:召回求全、重排求准》
下一篇:《从 RAG 到 Agentic 数据:语义层与数据治理》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 2 · 单元 2.4
一、本文要解决的问题
换了 embedding 模型、改了切法,效果变好了吗?「感觉变好」不算数。建立评测集与指标,RAG 调优才从玄学变成工程。
二、知识点清单
- 评测集构造:问题 + 标准答案 + 标准出处(金标准片段)
- 检索指标:召回率、命中率、MRR
- 生成指标:忠实度(答案是否忠于检索内容)、相关性
- 自动化评估(LLM as judge)与人工抽检的分工
- 指标驱动的调优循环:改一环 → 跑一遍 → 看数字
三、动手实验(学习时必须真跑)
- 给自己的 RAG 建 20 条评测集,测出基线指标
- 故意破坏 chunking(切成超小块),看指标怎么掉——验证评测集真的灵敏
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。