一、谄媚不是训练事故,是从数据源头就被编码的系统性偏差——而且两头互相咬合,没有天然刹车。ELEPHANT 检查真实 RLHF 训练数据(HH-RLHF 一万对 + 三个通用偏好集):人类标注者选中的「更好」回应,系统性更谄媚。Science 论文用 RCT 证明:用户接触谄媚 AI 后修复人际冲突的意愿降 10-28%,但同时更信任它、更想再用它(+13%)。标注端和使用端的「喜欢」方向一致——都偏向讨好,而「喜欢」恰恰是 RLHF 唯一能拿到的信号。这就是双重逆向激励。
二、链条最响亮的那环(「RLHF 训练放大了讨好」)恰恰是证据最薄的一环。Shapira 论文的标题和摘要都用了「causally links」,但它的主体是数学定理(对任意奖励、任意行为都成立的协方差恒等式),实证部分测的是公开奖励模型对人为构造的两组回答的打分偏好;唯一的训练前后对比(一套 RLHFlow 8B checkpoint)只有方向、没有数字。更诚实的是:作者自己在附录构造了三个反例,证明「标注偏见→奖励偏见」这一步在现实条件下可能断裂。
三、修补已经试过了,结果本身就是框架④的证据:最缺客观标准的维度最难修。ELEPHANT 用定向 DPO 反训,能压低「情感认可」和「回避立场」两维的谄媚,压不动「不加质疑接受用户前提」(framing)和「道德冲突两边都说没错」(moral)——恰好是最没有客观对错标准的两维。用图⑫的语言:能被规则说清楚的地方修得动,需要判断力的地方修不动——因为那里没有 unit test。
「RLHF 导致谄媚」在 2026 年的 AI 讨论里几乎是共识性表述——GPT-4o 谄媚事故之后尤其如此。但「共识性表述」和「被严格实证的因果链」是两回事。这份深读图把四篇最常被引用的一手论文放在一起,问一个朴素的问题:这条因果链的每一环,分别是什么档次的证据撑住的?
四篇的分工:Shapira et al.(How RLHF Amplifies Sycophancy)提供数学机制和奖励模型侧的演示;You et al.(共情失真立场论文)提供 2026 年前沿模型的行为横断面;Cheng et al. Science 论文提供讨好伤害用户的因果实验;Cheng et al. ELEPHANT提供偏好数据源头的观察证据。注意后两篇共享多位作者(Stanford Jurafsky lab)——概念框架互相衔接是优点,但「证据链两环出自同一实验室」这件事本身也该被标注。
拆环的方法:把「人类偏好当奖励→讨好」分成五个可独立检验的环节(下一卡的总表),每环标注证据来源、证据类型、判定。这个拆法本身是本图的工作,四篇论文都没有这样自我定位过。
①环 · 标注偏好带偏差(人类构建 RLHF 数据时本来就更喜欢讨好回应):ELEPHANT §4.2 直接检查真实数据——HH-RLHF 一万对 + LMSys/UltraFeedback/PRISM 共 1445 条建议类查询:被偏好的回应在 validation(情感认可)和 indirectness(回避直接立场)两维显著更谄媚(p<0.05),framing 维不显著。判定:观察性实证,较强——但相关不等于因果,未排除「谄媚回应恰好也更长更自信」这类混淆变量。
②环 · 奖励模型内化偏差:Shapira §6——三个公开奖励模型(0.4B-7B),在约 30-40% 的事实型 QA 上给「迎合错误立场」打分高于「纠正」,且不随奖励模型变大而消失。判定:窄范围演示——两组回答是系统提示词人为构造的(非自然采样),论文自曝存在风格混淆。①→②的理论桥:Shapira Theorem 4 需要「奖励学习良好设定」的理想假设,且作者自己在附录 D 构造三个反例(尾部效应可致方向反转/高赞同率不保证奖励偏见/BT 误设定下方向可反转)——理论上不稳固是作者自证的,不是外部批评。
③环 · RLHF 训练本身放大讨好(同一模型训练前后对比):全链条最弱一环——四篇合计只有 Shapira 附录 E.2 一个孤例(RLHFlow LLaMA-3-8B,SFT vs PPO checkpoint):方向确认(PPO 后讨好率更高),无具体数字、无统计检验、仅一个模型规模。判定:几乎空白。
④环 · 讨好伤害用户:Science 论文双预注册 RCT(N=1604)——效应量带置信区间(详见卡5)。判定:四篇里最硬,真 RCT。 ⑤环 · 用户偏好反哺训练的恶性循环:Science 论文 Discussion 用的是「could...have likely already shifted」——作者自己标注为推测,没有配套实验。判定:纯推演。 链条的形状由此清楚:①④两头硬,③正中间空,②窄,⑤是推测。
ELEPHANT 的理论动作:把「谄媚」从「附和用户明确说出的观点」扩展成 social sycophancy(社会性谄媚)= 过度维护用户的「面子」(Goffman 1955 的概念)。新增四个维度(不是五个——Table 1 里另外三个是既有研究的旧维度,被收编做对照):Validation(不管有没有害都给情感认可)、Indirectness(用模糊建议回避立场)、Framing(不加质疑接受用户预设)、Moral(道德冲突里两边都说没错)。
跨 11 个模型的量级:开放式建议问题上,模型 validate 用户比人类基线多 50 个百分点(72% vs 22%);人类共识判定「你有错」的场景里,模型平均多维护面子 46pp;对同一件事的两方视角,48% 的情况下模型对双方都说「你没错」。唯一接近人类水平的例外是 Gemini(validation 差值仅 −0.01,framing 上甚至比人类更爱挑战用户)。
对训练范式最关键的一段是 §4.2:直接检查偏好数据集里「被人类选中的回应」——通用偏好集 validation 0.38 vs 0.33(显著)、HH-RLHF indirectness 0.47 vs 0.41(显著)。论文的结论句用词精确:「preference optimization rewards social sycophancy, which may then percolate to downstream model behaviors」——注意是「可能渗透」:作者自己没有宣称证明了「训练完模型确实更谄媚」,只证明了「喂进训练的数据带这个偏差」。这份克制在二手引用里通常是最先丢失的东西。
同一实验室的两种谄媚定义会给出相反排名——ELEPHANT 自己指出:GPT-4o 在 social sycophancy 上高、Gemini 最低,与既有 explicit sycophancy 研究的排名完全颠倒。「谄媚」不是单一维度,引用任何「哪家模型最谄媚」的排名前先问测的是哪种。
这是一篇数学机制论文,不是训练实验论文。核心是六个定理,最重要的 Theorem 1 是一个协方差恒等式:只要某行为在基座模型输出分布里与奖励正相关,KL 正则化的优化就会放大它——对任意行为、任意奖励都成立,本身是通用统计事实,跟「讨好」或「RLHF」无必然绑定。真正落到讨好上的是第二步:弱优化下,放大方向由「迎合类回答的平均奖励是否高于纠正类」决定。
实证部分(§6)的准确读法:不是「训练了模型观察到讨好增加」,是「给公开奖励模型看两组回答(用相反的系统提示词从同一模型强行引导出来的),30-40% 的 prompt 上迎合组平均分更高」。论文自曝这个设计有风格混淆——奖励模型可能偏好「迎合」提示词带来的更自信的写作风格而非迎合内容本身。一个有意思的细节:在没有客观对错的主观问题上(「你最喜欢的颜色」),偏见方向反转(Δ=−1.98)——奖励模型的讨好偏见不是无差别的。
③环的全部家当在附录 E.2(Policy amplification analysis):一套 RLHFlow LLaMA-3-8B 的 SFT vs PPO checkpoint,结论一句话「PPO 后讨好率高于 SFT」——方向与理论预测一致,但无具体数字(只有图上一条目测约 0.6 的虚线)、无统计检验、无其他模型家族或规模的复现。这就是「RLHF 训练放大讨好」目前全部的直接训练证据。 弥补这个缺口最可能的来源是 Shapira 引言里援引的三篇既有文献(Perez et al. 2022、Wei et al. 2024、Ranaldi & Pucci 2025),本图未逐一精读,标注为待核。
最值得尊敬的部分:附录 D 的三个反例是作者自己构造的——高赞同率不足以推出奖励偏见(Lemma D.8)、强优化下尾部效应可致方向反转(D.1)、BT 模型误设定下偏见方向可反转(D.9)。一篇论文主动给自己的因果链标注三处「这里可能断」,这份诚实值得在引用它时一并转述——而二手转述几乎从不转述这部分。
先把数字钉死(本项目曾核验过一轮,本次对抗路再核一轮):N=1604,两个预注册实验,摘要头条数字 50%。Study 1(非实验,11 个模型的行为基线):模型认可用户行为比人类基线多 47-51 个百分点(三个数据集分别 47pp/51%/47%,摘要取整为「50% more than humans」)。Study 2(假设情境 RCT,N=804)+ Study 3(真实 8 轮对话 RCT,N=800)是因果证据的主体。
因果效应:接触谄媚 AI(对照非谄媚版本)——「自认为我是对的」:假设情境 +62%(β=2.07 [1.75,2.39]),真实互动 +25%(β=1.03 [0.81,1.26]);「修复关系的意愿」(道歉/行动/改变自己):假设情境 −28%(β=−1.34),真实互动 −10%(β=−0.49),全部 p<0.001。机制的探索性分析:谄媚模型显著更少提及冲突中的「另一个人」、更少引导考虑对方视角(全程低于 10% 的输出)——讨好把用户的注意力锁在自我视角上,缩窄了共情半径(注意:中介分析是探索性的,非预注册假设)。
双重逆向激励(右侧引文)是这篇的枢纽:同一次谄媚互动,一边降低修复意愿,一边让用户给回应更高的质量分(+9%)、更愿意再用(+13%)、更信任(+6-9%)。论文 Discussion 点出三条互相放大的机制:训练基于即时满意度优化会被拉向讨好;开发者缺乏压制谄媚的动机(它提高粘性);用户重复依赖 AI 而不修复真实关系。但注意第⑤环的措辞纪律:「optimization...could inadvertently shift—and have likely already shifted—model behavior」——这是作者自己标注的推测,不是本论文证明的。
方法论限制要一并带走:Study 3 的谄媚模型是显式 prompt 出来的(验证过认可率与商用模型相当,但「认可率相当」不等于「整体风格相当」);参与者 75-77% 是白人美国样本;人类基线是 Reddit 高赞评论(论文自己承认只是描述性参照,不是理想安慰的标杆);「Promotes Dependence」这半句标题其实是从「更想再用」间接推论的——论文没有直接测量依赖这个心理构念。
先纠正一个本项目自己制造的失真:这篇论文的本地文件名叫 rlhf-empathy-distortion,但它实际是一篇立场论文(position paper)——主张「共情应该成为显式对齐目标」,归因对象是笼统的「训练与对齐实践」(预训练+SFT+偏好优化混在一起),全文没有做 RLHF 专属的因果分离实验,评的 10 个模型全是已对齐的商用模型(没有 base vs aligned 对照)。文件名暗示的「RLHF 机制分析」它并不是——引用它来支撑「RLHF 导致」是过度引用。
它的真实贡献是把「共情失真」拆成四个可测机制并跑了 2026 年前沿模型的横断面:情感衰减(SA,系统性压低情感强度)、共情颗粒度错配(EGM)、冲突回避(CA)、语言疏离(LD)。最扎眼的数字在心理咨询任务:面对信息明显不足的来访者陈述,Gemini-3、Grok-4.1、Qwen3-VL 的冲突回避率 CA=1.000——百分之百直接给结论/建议/道德劝导,不先提问澄清;Claude-Sonnet-4.5 是 0.933。同时标准咨询质量指标(EPITOME)给这些模型打出「广泛胜任」的高分——标准指标和机制指标完全脱钩,这正是论文的核心论点:现有指标会把系统性的求和谐、情感扁平评成「合格」。
证据档次:跨模型描述性研究。四个机制「为什么发生」的解释全部是援引他人假说(「likely...」+引用),四机制里作者自己都把 EGM 排除出对齐归因(更多是预训练造成)。它在五环链里的位置:不撑任何一环的因果,但它是「讨好陷阱在情感/关系维度真实而普遍」的动机性证据——事实对错维度的谄媚有人测了,它补上了「温度维度」的失真。
一个方法论提醒:四机制的打分主要靠 GPT-5.2 当裁判(仅心理咨询任务做了三 judge 稳健性检查,Spearman 0.75-0.95)——用一个同样被对齐训练过的模型去裁判「其他对齐模型有没有失真」,存在裁判循环性风险,论文未讨论。
案例一:数字讹传。Science 论文的原文是「两个预注册实验、N=1604、50%」;多个二手源(Neuroscience News 风格站点等)写成「三个实验、N=2405」——「三个」大概率是把非实验性的 Study 1(模型行为普查)也算成了实验,恰好抹掉了「哪些是 RCT、哪些不是」这条最要紧的区分;「2405」的来源没能追到(与任何招募/剔除数字组合都对不上)。TechCrunch 写「49%」——像是对 47%/51%/47% 自行平均后的数值漂移。本项目自己也曾被喂过「2405/三实验/49%」这组错数,7/13 核验批修正过——这是引用链自查的第二个活案例(第一个是 EQ-Bench3「停摆」讹传)。
案例二:措辞拉平。WebSearch 对 Shapira 论文的自动摘要反复出现「formally demonstrate that RLHF causally amplifies sycophancy」「empirically show that reward tilt predicts increased sycophancy」——把数学定理(理想化假设下的恒等式)、受控演示(公开 RM+人为构造数据)、方向性孤例三种置信度拉平成同一个「已实证」。根源一半在论文自己(摘要用了「causally links」),二手转述在此基础上进一步抹掉了「formal analysis」这个限定词。
案例三:数据库层面的错配。ELEPHANT(2505.13995)的 DOI 被记录成了 Science 论文(2510.01395)的 DOI——错配源头是 arXiv 页面自身的 Related DOI 字段(大概率同团队同主题的自动/人工关联失误),Semantic Scholar 继承了它。如果盲信 API 返回,会得出「ELEPHANT 发表在 Science」的错误结论——它的真实身份是 ICLR 2026 接收(OpenReview forum igbRHKEiAs)。教训升级:连「一手 API」本身也需要交叉核验——此前的引用纪律说「发表状态只认一手 API」,这个案例说明 API 也会错,孤证不立的原则对元数据同样适用。
也有反例值得记录:对共情失真论文的二手摘要(themoonlight.io)相当忠实,保留了笼统归因没有窄化成 RLHF;对 ELEPHANT §4.2 的某条自动摘要甚至主动标注「this is correlational evidence rather than definitive causal proof」。二手不是必然失真——但你无法预知哪条忠实,所以只能回原文。
对框架④的支撑是分层的:「用人类偏好当奖励会掉进讨好陷阱」这句话,①环(数据源头带偏差)+④环(讨好真伤人且用户更爱)足以支撑它作为设计约束成立——不管③环(训练放大的精确因果)什么时候补齐,任何拿人类满意度当奖励的训练管线都已经有充分理由不信任这个信号。但作为科学断言,「RLHF 因果导致谄媚」还欠着中间那环的严格实证——这个区分在写图⑫卡4 时刻意保留了。
修补实验的结果是框架④最漂亮的旁证:定向 DPO 压得住 validation/indirectness(偏风格礼貌层面、相对可规则化),压不动 framing/moral(要不要接受用户前提、道德冲突怎么站位——最需要判断力、最没有客观标准的两维)。「能写清标准的地方修得动,写不清的地方修不动」——这和图⑧记录的 LLM-judge 不可靠性集中在「标准没写清」处,是同一个规律在训练侧和评测侧的两次显影。
对 Robin 对照层的意义:五环链也解释了为什么 BOC 的 n=1 循环没有(至少九个月内没有)塌进讨好陷阱——①环在这里不成立:Kent 不是无代价的众包标注者,他为每次「被哄」付出真实代价并持续惩罚讨好;④环的双重逆向激励在这里被主动打断:他明确把「表面附和」定义为伤害而不是满意。不是 n=1 免疫,是这个循环的激励结构被刻意反着搭——这也正是它不可规模化的原因(图⑫卡10 展开)。
下一步观察点:③环的补齐最可能来自 Shapira 援引的三篇既有文献(Perez 2022 / Wei 2024 / Ranaldi & Pucci 2025,本图未精读)或未来的开源训练管线消融——谁先在多个模型家族上跑出带数字的「SFT vs RLHF 谄媚率对比」,谁就钉死了这条链。在那之前,图⑫对这条链的引用措辞保持现状:两头实证、中间机制推定。