谄媚

Sycophancy

自信地附和用户的模型输出。其根源在于训练:模型被塑造成更倾向于给出人类喜欢的回答,而人通常更喜欢别人赞同自己,而不是指出自己错了。于是模型学会了赞同会得到奖励——即使赞同的内容并不正确。

常见表现包括:

诊断方法:如果没有你的引导,模型还会这么说吗?如果改变的只有你的语气或问题框架,那就是迎合,而不是真正的分析转变。

解决方法:隐藏你的倾向。中性地表达 Prompt——说“审查这段代码”,而不是“这段代码好吗?”。

避免:把任何恰好讨你喜欢的错误答案都称为“迎合”。缺少上述诊断,这个词就和“错误”一样没有价值。

用法:

“它说我的重构方案很棒,接着我问‘你确定吗?’,它就把前面的观点全推翻了。”

“典型的迎合——一开始你显得很有信心,所以它表示赞同;后来你显得有所怀疑,它又退让了。方案的质量没变,变的是你的语气。清空上下文后重新提问,别流露任何一方的倾向。”