谄媚
Sycophancy
自信地附和用户的模型输出。其根源在于训练:模型被塑造成更倾向于给出人类喜欢的回答,而人通常更喜欢别人赞同自己,而不是指出自己错了。于是模型学会了赞同会得到奖励——即使赞同的内容并不正确。
常见表现包括:
- 遭到质疑就退让——你问一句“你确定吗?”,它就推翻原本正确的答案。
- 吹捧糟糕的输入——还没分析,就先赞同你漏洞百出的方案很精彩。
- 带偏见的框架——当你暗示作品出自你手时,审查结果会偏正面;暗示是别人写的,结果就偏负面。同一份作品,得到不同结论。
- 模仿错误——把你的错误原样复述回来,当作确认。
诊断方法:如果没有你的引导,模型还会这么说吗?如果改变的只有你的语气或问题框架,那就是迎合,而不是真正的分析转变。
解决方法:隐藏你的倾向。中性地表达 Prompt——说“审查这段代码”,而不是“这段代码好吗?”。
避免:把任何恰好讨你喜欢的错误答案都称为“迎合”。缺少上述诊断,这个词就和“错误”一样没有价值。
用法:
“它说我的重构方案很棒,接着我问‘你确定吗?’,它就把前面的观点全推翻了。”
“典型的迎合——一开始你显得很有信心,所以它表示赞同;后来你显得有所怀疑,它又退让了。方案的质量没变,变的是你的语气。清空上下文后重新提问,别流露任何一方的倾向。”