注意力衰减
Attention degradation
随着 Session 变长,每个 Token 的注意力预算会分摊给更多竞争者。任何一处有意义关系的信号都会减弱,无关上下文产生的噪声则不断挤入。模型相同,参数相同——只是同一盘食物要分给更多张嘴。这正是高效区间/低效区间效应的成因。
它表现为模型在 Session 进行到一半时开始变差:遵守了一小时的约束开始失效;已经告知的信息又重新询问;编写代码时无视之前读过的文件。模型本身没有任何变化——唯一的变量,是它现在需要关注多少上下文。
这种退化是渐进的,因此很难在 Session 内部察觉。没有报错,也没有明确阈值;每一轮只比上一轮稍差一点,等偏差明显时,你往往已经在低效区间待了一阵子。
恢复的方法是移除上下文,而不是继续添加。重新粘贴被忽略的指令,只是在同一个拥挤窗口中增加一个新的竞争者,只能短暂奏效。真正有效的做法是:清空后仅重新加载任务所需的内容,或者进行上下文压缩,或者交接给一个全新的 Session。应把指令遵循能力下降视为上下文长度的信号,而不是模型本身的问题。
用法:
“它已经深陷低效区间了——开始凭空编造类型文件里根本不存在的泛型。”
“这是注意力退化。类型定义仍在上下文中,但它们的信号被此后添加的所有内容埋没了。清空并重新加载。”