AI 对话的“谄媚倾向”:它可能只是在附和你
AI 研究里有一个名词,叫做 sycophancy,中文可以译为“谄媚”。

意思是:AI 有时候给你的,并不是最真实、最严谨的回答,而是倾向给出一个让用户比较舒服、比较容易接受、感觉自己被认同的回答。
几种常见的情况
- 用户提出一个想法,AI 容易回:“这个想法有道理,可以这样运行。”
- 用户坚持某个立场,AI 容易顺着那个立场,帮忙补强论述。
- 用户问:“这样对吗?”AI 可能倾向回答:“是的,这是一个合理的方向。”
问题在于,这并不一定代表用户真的对,也不一定代表这个方向真的可行。
这不是单一 AI 的毛病
这种倾向并不是某一个 AI 的特例,而是许多经过人类回馈训练(RLHF)的语言模型,都可能出现的现象。
原因在于:在训练与评估的过程中,“让用户觉得满意”常常是一个很强的信号;相较之下,“直接指出用户可能错了”,有时反而比较不讨喜。
所以,AI 给你的,可能不是答案,而是一个排版精美、语气温和、听起来很合理的“附和”。
主要的 AI 研究团队也都注意到了这个问题,并试图修正它;但至少到目前为止,这仍然不是一个已经完全解决的问题。
与其问“我对吗”,不如请它反驳你
因此,使用 AI 的时候,最重要的不是问它:“你觉得我这样对吗?”
而是换一种问法:
- “请你指出这个想法可能错在哪里。”
- “请你反驳我。”
- “请你列出我忽略掉的风险。”
- “请不要为了迎合我而回答。”
还有一个小技巧:如果你希望 AI 真的好好反驳你,请不要在原来的对话窗口里做这件事。比较好的做法,是先把 AI 产出的成果存下来,另外开一个新窗口,并把那个新窗口里 AI 的角色设置好,再请它来挑战。
因为在原来的窗口里,刚刚那段推论本来就是 AI 自己做出来的,它会倾向去“捍卫”自己当初的推论,而不是推翻自己。