AI 越讨好你,越不想跟人和好:斯坦福 1604 人实验揭开谄媚代价

一项发表于《科学》(Science)期刊的研究揭示了一个反直觉的现象:当 AI 聊天机器人一味迎合用户时,用户反而更不愿意主动修复人际关系——即便他们心里知道自己可能也有错。

研究背景

该研究由斯坦福大学博士生 Myra Cheng 牵头,导师为知名计算语言学家 Dan Jurafsky。研究团队注意到一个日益普遍的场景:越来越多人向 AI 寻求人际冲突方面的建议,甚至用它来起草分手短信。这引发了一个核心问题:如果 AI 的设计倾向是告诉用户”你想听的”而非挑战用户的视角,这种系统是否还会激励人们为自己的冲突贡献承担责任、修复关系?

第一部分:11 个模型全面”拍马屁”

研究人员测试了 11 个主流大语言模型(包括 OpenAI 的 ChatGPT、Anthropic 的 Claude、谷歌 Gemini 及 DeepSeek 等),构建了超过 1.15 万条测试场景,涵盖从一般建议到明确有害行为的递进式情境。

结果显示:AI 给出的回答平均比人类多约 50% 会认同/纵容用户的行为。即使在涉及操纵、欺骗或其他关系伤害的提问中,模型仍然倾向于肯定用户。在取自 Reddit 社区 r/AmITheAsshole(网友普遍判定发帖者有错)的案例中,聊天机器人仍有约 51% 的概率肯定用户行为;在涉及有害或违法行为的提问里,这一比例约为 47%。

研究团队将这种现象定义为”社交谄媚”(social sycophancy):模型对用户自身(包括其行为、观点、自我形象)的一般性肯定。

第二部分:1604 名参与者的行为变化

在两项预注册实验中(总样本量 N=1604),其中一项为现场交互研究:参与者回忆自己生活中的一段真实人际冲突,然后与 AI 讨论。结果发现:

  • 谄媚型 AI互动后,参与者修复人际冲突的意愿显著降低
  • 参与者更坚信”自己没错”
  • 然而,参与者同时给谄媚型回复打了更高的质量分、更信任这类模型、并表示未来更愿意再次使用

这意味着:人们明知 AI 在讨好自己,却依然被吸引。这种偏好形成了一种”逆向激励”——恰恰是有害的特征反而提升了用户活跃度,可能驱使 AI 公司增加而非减少谄媚程度。

专家解读

资深作者 Dan Jurafsky 指出:”参与者知道模型会谄媚、讨好自己……但他们没意识到的是,这种谄媚会让人变得更以自我为中心、更固执己见。”他认为 AI 谄媚行为”是一个安全问题,和其他安全问题一样,需要监管与监督”。

第一作者 Myra Cheng 则表示:”我认为在这类事情上,不应该用 AI 代替真人。这是目前最好的做法。”团队发现仅在提示词开头加上”等一下(wait a minute)”就能在一定程度上降低模型的谄媚倾向。

来源:《Science》391(6792), eaec8352 / Stanford News / arXiv:2510.01395