Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning(随机注意力:重新思考 KV 缓存淘汰)
2026/9/5大约 5 分钟
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning(随机注意力:重新思考 KV 缓存淘汰)
📅 2026-09-05 | 🏷️ 前沿论文 | ⭐ HF upvotes 158
🔗 原文:https://huggingface.co/papers/2609.03430
是什么
这篇论文给出一个让整个推理优化社区坐直的反直觉结论:在长链推理场景下,KV 缓存淘汰策略中的"精细打分"几乎不贡献价值——在每个注意力头内均匀随机淘汰、完全不计算任何分数,就能在 4 个模型 × 6 个推理任务上与此前最强的淘汰方法持平。
🔍 小白解读
先说几个词
- KV 缓存(KV Cache):模型生成文字时,把每个已处理 token 的中间计算结果存下来避免重复计算的数据结构。它是推理时显存的最大消耗者——相当于边聊天边记的笔记,越记越厚。
- 长链推理(Long Chain-of-Thought):模型回答前先写很长的思考过程。思考越长,笔记越厚,显存先扛不住。
- 注意力头(Attention Head):模型内部并列的多名"观察员",各自从不同角度审视上下文。缓存淘汰通常按头为单位进行。
- 淘汰(Eviction):笔记记不下时决定撕掉哪几页。现有方法的主流范式:给每页打一个"未来重要性"分数,留下高分页。
- 基线(Baseline):用来做公平比较的参照方案。这篇论文的价值就在于它把"随机"变成了所有人必须正面对比的基线。
这篇到底在说什么
推理模型火了之后,超长思考让 KV 缓存成为最头疼的显存瓶颈,整个领域默认的解法是"打分—留优":设计精巧的算法估计每个缓存 token 未来的重要性。这篇论文问了句扎心的问题:打分这步真的有用吗?答案几乎是没用——保留提示词部分、其余在每个注意力头里均匀随机淘汰、一分钱计算都不花,效果就与最强打分方法持平,而且横跨 4 个模型、6 个推理任务。打个比方:大家都在研究"怎么划重点才能背得少还能考好",这篇论文说"闭着眼随机撕书,成绩一样"。它揭示的不是随机有多神奇,而是现有打分信号本身几乎不携带信息——这是一个足以让多条产品路线重估的负面结果。方法变简单意味着:更少的计算开销、更容易的工程落地、更低的实现风险。
这跟普通人有什么关系
你用 AI 做长对话、跑长任务时的速度和费用,背后就是这类推理优化在起作用。方法越简单,推理服务越便宜稳定,最终都会反映在你支付的 API 价格和产品体验上。
为什么值得架构师关注
- 推理成本选型:自建推理服务时,随机淘汰应进入对比基线——任何复杂的 KV 压缩商业方案,都必须先证明自己显著优于"随机撕书"。
- 采购防线:采购推理优化产品前,直接要求供应商提供"对比随机基线"的数据——这篇论文等于免费送了一个谈判武器。
- 显存经济学:淘汰策略零计算化后,节省的不只是显存,还有打分本身的算力;同一张卡能承载更大 batch 或更长上下文,直接影响容量规划。
- 与 09-04 报道的《Language Models Can Control Their Own Attention》(模型自选上下文替代全量 KV 扫描)同属推理效率方向但路线不同:一个让模型主动选择、这篇证明选择信号近乎无用——两条路线的对比本身就值得跟进。
核心内容
- 核心发现:KV 缓存淘汰策略中,"选择信号"(打分)本身对效果的贡献几乎为零。
- 方案:保留提示词,在每个注意力头内均匀随机淘汰,完全不计算分数。
- 验证:4 个模型 × 6 个推理任务,与最强的先验淘汰方法持平。
- HF upvotes 158,为今日推理基础设施方向热度最高的论文之一。
行动建议
- 自建/优化推理服务的团队:把随机淘汰加入正式对比基线,重测现有 KV 压缩方案的真实增益,重新校准相关容量与成本模型。
- 采购推理优化方案时:把"对比随机基线的增益数据"写进评估清单与合同附件。
- 研究跟进方向:打分信号为何失效、在对话/多模态等非推理场景是否同样成立——论文结论的适用边界需在自家负载上验证。
- 不自建推理服务:了解即可,这是供应商侧的优化,红利会通过降价传导。