Language Models Can Control Their Own Attention(语言模型可以控制自己的注意力)
2026/9/4大约 2 分钟
Language Models Can Control Their Own Attention(语言模型可以控制自己的注意力)
📅 2026-09 | 🏷️ 🧠 前沿论文 | ⭐ HF upvotes 51
🔗 原文:https://huggingface.co/papers/2609.02737
是什么
针对长上下文推理成本的研究。出发点是一个朴素的观察:模型的注意力其实只集中在上下文的很小一部分 token 上,但生成每个 token 时仍要扫描完整 KV cache——在 1M token 的对话里检索一个早期细节,全局注意力层每生成一个字都要全量扫一遍。已有的缓解方案用轻量代理分数「预选」相关 token,但这个外在打分步骤本身仍带来每步 O(N) 的开销。本文走内在(intrinsic)路线:模型自己就知道上下文哪些部分相关——让它控制自己的注意力。
为什么值得架构师关注
长上下文是 RAG 之外的另一条「记忆」路线,其成本瓶颈恰恰在注意力的全量扫描上。如果模型可以内在地自选相关 token,长上下文推理的每步成本有望摆脱 O(N),这会直接影响:推理网关的成本模型、KV cache 管理/serving 栈的设计、以及「RAG vs 长上下文」的选型天平。推理效率方向的论文很少有这么直接的账单含义。
核心内容
- 观察:语言模型大部分注意力集中在上下文的少部分 token,却每步都读全量 KV cache
- 现有方案(extrinsic 轻量代理打分预选 token)仍引入 O(N)/step 的额外开销
- 本文提出 intrinsic 方法:由模型自身判断并选择相关上下文,而非外部打分
- 动机场景:1M-token 级对话中的历史细节检索
- 工程含义:直接影响 KV cache 管理与长上下文 serving 栈的实现策略
行动建议
自建推理栈或做长上下文产品的团队:跟踪代码开源与复现情况,评估其与现有 vLLM/推理网关方案的适配路径;做「RAG vs 长上下文」路线评估时,把这类推理优化计入成本模型。不碰推理基础设施的团队了解即可。