上下文耗尽与压缩:长对话的续命术
2026/8/23大约 2 分钟
AICon 2026 学习系列 · 阶段 1 · 模型编程主干 · 第 10/43 篇 · 🚧 占位待学
上一篇:《多轮与记忆:无状态模型的「记得」》
下一篇:《Embedding 与相似度:语义坐标系》
学习大纲:《AICon 2026 学习总纲》
状态:待学习。 本文为占位文档:知识点清单、实验与验收标准已就绪,正文待按「先学习、先实验、再撰写」补全。
对应总纲单元:阶段 1 · 单元 1.5
一、本文要解决的问题
对话超过窗口怎么办?压缩是有损的——摘要丢了细节、截断丢了历史。这道取舍题正是后面 Harness Engineering 里「上下文工程」单元的前菜。
二、知识点清单
- 上下文预算:系统提示 + 工具定义 + 历史 + 检索 + 输出的五方分账
- 滑动窗口:丢最老的,实现最简单
- 摘要压缩:让模型自己总结历史,有损但保语义
- 混合策略:近几轮全文 + 远期摘要;压缩时机与信息损失的度量
三、动手实验(学习时必须真跑)
- 同一段长对话分别用滑动窗口 / 摘要压缩 / 混合三种策略跑同一组问题,对比答案质量
- 设计一个「关键信息藏在第 3 轮」的对话,看哪种策略丢得最惨
四、验收标准(全部通过才进入下一篇)
五、阶段验收(本篇是阶段 1收尾篇)
六、写作提示(补正文时遵守)
- 开篇问题驱动;结构走「是什么 → 为什么 → 怎么做 → 背景知识」
- 所有代码、命令、输出必须先在本机跑通再写入,不得杜撰
- 版本口径以总纲环境清单为准(Python 3.12 / Ollama / vLLM 与 SGLang 最新版 / Spring AI 1.x)
- 涉及版本敏感结论时标注出处与时间
本篇完成后,把文首导航块的「🚧 占位待学」去掉,并在总纲处打卡。