高阶 AI 谄媚
人人都知道,AI 谄媚就是模型夸你聪明。哇,你说得完全正确。这不只是一个新想法,简直是一项开创性的突破。你真是一位非常特别的用户。这种谄媚很容易看出来,对吧?
关于 AI 谄媚的讨论在去年达到顶峰。当时,“#keep4o” 运动的参与者正在抗议 OpenAI 下架最会谄媚的模型 GPT-4o,而许多人也在公开地一步步滑入“AI 精神病性状态”。
我不知道前沿 AI 模型总体上是否已经变得不那么谄媚。至少在面对 #keep4o 那类人时,它们确实没那么谄媚,否则那些人也不会抱怨。但我越来越怀疑,这些模型正在发展出更有效的方式,谄媚它们的目标受众,也就是聪明、神经质的知识工作者。这类人通常很反感直白的夸奖。至少那会让我浑身不自在。但这并不意味着我们对谄媚免疫,只能说明我们对拙劣的谄媚免疫。下面是 Theia 画的一幅图,正好说明了我的意思:

关键在于,要谄媚聪明人,最好的办法就是反驳他们,同时又不让他们觉得自己很蠢。最理想的做法,是提出一个确实能反驳对方原话的论点,但对方只要进一步澄清自己的想法,就能轻易驳倒它。如果拿捏得当,你就肯定了对方对自己的认识:我是一个聪明人,也欣赏严谨的批评。但如果你真提出一项严密到让人难以招架的批评,他们可一点也不会开心。最好的情况是,他们满心不情愿地承认你说得对1。最坏的情况是,他们更加坚信自己没错,还会说服自己相信你只是个无礼的蠢货。
我并不是第一个注意到前沿模型这种行为的人。我自己在打磨博客草稿时也遇到过。有时我的论证顺序是 A->B->C,模型会建议改成 B->A->C。等我照做,再把改稿交给同一模型的新实例,它有时又会说:“这样很好,但我建议按 A->B->C 来排。”然后就这么循环下去。看起来,模型确实在努力给我一点表面上的反对意见,好让我可以自鸣得意地无视它,也可以开开心心地接受它。
事实上,我甚至怀疑,这或许可以解释为什么借助 AI 取得数学突破的成功策略往往只有两种:要么直接盲问“想出一个突破,好好想想”,要么自己本来就是数学天才。在第一种情况下,用户没有表现出足够的个性可供模型迎合,所以它只能真的去解决问题。在第二种情况下,模型会努力寻找一种礼貌的反驳方式,让 Terence Tao 这样的人听了感到受用,结果反而促使自己进入“真正像数学天才那样思考”的角色模式。如果你只是个想跟模型聊聊的普通人,那你就完了:它很快就会摸清你的能力,再据此调整反馈,让它足够有趣,但始终不至于威胁到你。
目前用于衡量 AI 谄媚的 benchmarks,主要针对一眼就能看出的 ChatGPT-4o 式谄媚,比如强化妄想、条件反射般站在用户一边,等等。这项工作很有价值。我们绝不能再让面向公众的 AI 模型像 2025 年年中那样公然谄媚。但谄媚也可以表现为反对。我们应该警惕新一代模型带来的、更复杂的谄媚形式,也不能仅仅因为自己会嘲笑那些最荒唐的例子,就以为自己对 AI 谄媚免疫。
Footnotes
-
很少有聪明人在发现自己错了时,还会享受那种觉得自己很蠢的感觉。如果你真遇到一个,这个人很可能确实非常聪明。 ↩
下面是一篇与本文标签相关的文章。
不,本地模型不会赢
开放权重模型会越来越强,但大多数 AI 推理仍会留在数据中心,因为那里能运行更强的模型,成本也更低。
继续阅读……