评测(Evals):Agent 的测试工程
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 4 · Harness 工程 · 第 23/43 篇 · 🚧 占位待学
上一篇:《上下文工程:稀缺资源的预算分配》
下一篇:《可观测性:多步执行的调用树》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 4 · 单元 4.2
一、本文要解决的问题
后端有单元测试与压测,Agent 有什么?evals。没有评测集,每次改 prompt 都是在换签抽奖——「Agent 调优没有评测集 = 后端优化没有压测」。
二、知识点清单
- 评测集构造:任务 + 期望结果 + 评分方式(精确匹配 / 规则 / LLM judge / 人工)
- 通过率与回归:改一版跑一遍,防止按下葫芦浮起瓢
- 轨迹评测 vs 结果评测:过程对不对也要看
- 在线评测:灰度、抽样、用户反馈回流
三、动手实验(学习时必须真跑)
- 给阶段 3 的 Agent 建 20 条用例集(含 5 条故意刁钻的)
- 改一版 prompt 跑回归,记录通过率变化
四、验收标准(全部通过才进入下一篇)
五、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。