注意力预算

Attention budget

每个 Token 能够分配给上下文其余部分的影响力都是有限的。如果某一种关系占用了大量影响力,留给其他关系的就会减少。这份预算按 Token 计算,不会随着上下文增长而增加,因此长 Session 中的注意力会被稀释。

可以把它理解为信号与噪声。你的指令是一个音量固定的信号;上下文窗口里的其他每个 Token 都是与它竞争的声音。指令本身并没有变弱——它仍然原封不动地在那里——但随着上下文增长,周围环境越来越嘈杂,信噪比随之下降。一条在 1 万 Token 上下文中最响亮的指令,到了 15 万 Token 时就成了背景嗡鸣。这就是注意力退化背后的机制:模型并没有忘记,只是信号淹没在了噪声中。

它表现得像是不听指令:Agent 在早期同意遵守某项约束,之后却逐渐偏离;重新粘贴这项约束也只能短暂奏效。问题不在指令本身,而在窗口中的其他所有内容都在与它竞争。

你能控制的是哪些内容进入上下文。与任务无关的内容并非无害——它会成为噪声,干扰所有真正有用的内容。尽量缩小窗口;当累积的上下文得不偿失时及时清理;重要约束要重新申明,不要指望早期提过一次就能始终有效。

用法:

“为什么它总是无视我一开始粘贴的 schema?”

“我们已经深入低效区间了——每个 Token 的注意力预算是固定的,但上下文还在不断增长。schema 的信号现在要与后面新增的数千个 Token 竞争。”