一、「verifiable」在这篇论文里的真实含义,比它听起来的弱得多。数学/代码领域的可验证奖励(RLVR),指奖励来自一个不能被说服、不能被讨好的外部检查器(测试跑没跑过)。RLVER 的「确定性情绪分」是 DeepSeek-V3 按固定五步流程现场打的分——流程透明、可审计、可复现,但打分主体仍是一个可能有系统性偏好的 LLM。论文把「verifiable」悄悄用成了「deterministic(流程确定)」,这个偷换发生在给方法命名的核心段落,是全文修辞的地基。
二、13.3→79.2 这个数字的正确读法:不是「共情能力接近 GPT-4o」,是「讨好这个特定模拟用户的能力接近 GPT-4o」。训练时发奖励的模拟用户,和评测时算分的模拟用户,是同一个模型(DeepSeek-V3-1226)+ 同一套打分模板;评测基准 SAGE 和 RLVER 是同一个腾讯团队(作者重叠 10+ 人);「情绪分与心理学量表相关」的效度背书,是同团队在另一篇论文里用 100 个场景做的一次检验。训练集和测试集实例确实不重叠——但它们是同一个分布生成器的两次采样。
三、这篇论文最值得带走的,反而是它自己做的一个反直觉实验:验证器不是越严越好。把模拟用户改造得「更难搞定」(更少直接透露情绪),训练效果反而暴跌(非思考版 61.7→19.8)——苛刻的验证器在探索期给的反馈太稀疏,模型找不到成长路径。这对任何想给情感训练造执行器的人都是一课:验证器的反馈密度和信噪比,跟它的客观性一样要紧。顺带的推论很冷:真人比论文里任何「挑战版模拟器」都更不配合——没有理由相信这套配方能稳定泛化到真人。
数学和代码这两年靠「可验证奖励强化学习」(RLVR)能力突飞猛进:答案对不对是跑出来的事实,奖励客观、即时、便宜、不可讨好。情感对话一直吃不到这个红利——「这句安慰好不好」没有标准答案,传统做法要么用人类偏好当奖励(RLHF,会掉进讨好陷阱),要么训一个神经网络奖励模型(会被 reward hacking 攻击、不可解释)。
RLVER 问的是:能不能给情感对话也造一个「可验证」的奖励源? 它的方案:不训奖励模型,改造一个「有自我一致内心世界的模拟用户」(Sentient Agent)——有人设、有背景故事、有对话目标、有隐藏意图,每轮对话后按固定流程更新自己的情绪分(0-100),拿这个分数直接当 RL 奖励。论文给这个闭环起名 Heart-in-the-Loop。
为什么这篇论文在图⑫里站在正中央:它是「框架④——建立便宜且不可讨好的验证循环」在公开文献里第一次被认真尝试的样子,而它的成与败恰好把这条框架的两半都照亮了——「便宜」做到了(不需要人类标注),「不可讨好」没做到(见卡4-6)。
模拟用户的构造(借用同团队 SAGE 论文的框架):每个模拟用户由四要素实例化——详细人设、对话背景、显式对话目标、隐藏意图。生成走两步 LLM 提示链:给 3 句台词种子推出人物画像,再扩写出事件起因、冲突、当前状态。全部 prompt 模板公开在附录 E.1。
情绪分的产生(每轮):模拟用户收到被训模型的回复后,按强制的五步结构化流程打分——理解对方想表达什么(Content)→ 是否契合自己的目标/隐藏意图(TargetCompletion)→ 自己的心理活动(Activity)→ 对这条回复的感受(Analyze)→ 输出一个 −10 到 +10 的情绪变化值(Change)。Change 累加到 0-100 的情绪分上,再映射到 5 档情绪状态(每档对应不同说话风格;≥100 可以满意告别,<10 可以社交失败退出)。
奖励与训练:终局奖励 = 对话结束时的情绪分/100;中间步直接用瞬时情绪分。被训模型是 Qwen2.5-7B-Instruct(刻意选没在情感数据上微调过的基座,保证提升可归因于 RL);2×2 消融:PPO vs GRPO × 思考(回复前强制 <think> 内心独白)vs 非思考。训练 500 个场景、测试 100 个,8 类隐藏意图分层。
执行打分的模型:DeepSeek-V3(附录注明具体版本 V3-1226)——注意这一点,它是卡5 整条批评的起点:这个模型既在训练时发奖励,也在评测时算分。
主结果(Table 1,Sentient Benchmark,测试 100 场景):基座 Qwen2.5-7B 得 13.3;PPO+思考版训到 79.2——越过 Gemini2.5-Flash-Think(66.1)和 OpenAI-o3(62.7),逼近 GPT-4o(79.9)和榜首 Gemini2.5-Pro(82.4)。注意:逼近,没有反超榜首——摘要「rivaling proprietary models more than an order of magnitude larger」是准确的,但要按这个精度理解。
通用能力基本保住(Table 2):最佳共情模型(PPO+Think)Math500 77.8→76.6(微降)、LiveCodeBench 26.7→28.0(反升)、IFEval 70.4→68.6(微降)——没有灾难性遗忘。这是真正独立的第三方基准,值得认可;但它们回答的是「训练有没有搞坏别的能力」,不是「共情能力泛化了没有」——论文行文容易让人把两件事混起来。
思考模板是稳定性关键:思考版在共情深度(3.56 vs 3.10)和核心洞察上明显更强,非思考版偏行动导向;PPO 配思考冲到最高分但方差大,GRPO 更稳。最有教益的消融在 §3.4:换「更难搞定」的模拟用户训练,效果反而暴跌(非思考 61.7→19.8;思考 79.2→66.4)——而且用难版模拟器专门训出来的模型,在难版评测上反而不如简单版训出来的(44.7 vs 59.6)。论文的解释:过于苛刻的模拟器在探索期反馈太稀疏。这说明整套方法对「模拟用户设计得对不对」极度敏感——验证器本身成了一个需要精心调校的对象,跟框架④理想中「便宜且不用维护」的执行器有实质落差。
论文对自己方法的辩护核心句(§2.1):「we implement deterministic emotion scores from the user simulation engine S as interpretable proxies for simulated user satisfaction, thereby circumventing the opacity pitfalls of learned reward functions」——把「确定性情绪分」和「习得的黑箱奖励模型」对立起来。这个对立是成立的:SAGE 打分走固定五步流程+固定数值更新公式,每一步推理都可读可查,确实比一个只输出标量的神经网络奖励模型更难被察觉不到的捷径攻击。
但「verifiable」的原产地含义被换掉了。RLVR 在数学/代码领域指:奖励来自独立于任何 LLM 判断的外部检查器(测试运行器、形式化验证器),它不能被说服。RLVER 的情绪分是 DeepSeek-V3 每次现场跑一遍思维链打出来的——「给定同一段对话,打分流程确定、可审计」和「这个分数忠实反映真实用户会有的反应」是两个独立命题,前者不蕴含后者。论文全篇没有报告打分温度是否为 0、没有做同一对话打两次分的一致性检验——连「数值层面的确定性」都没有被验证过,更不用说「与真实用户反应的一致性」。
准确的翻译应该是「流程可审计性」(process auditability),不是「可验证性」(verifiability)。这不是抠字眼:这篇论文的标题词已经被 10+ 篇后续论文原样继承(痴呆照护、CBT 咨询、角色扮演都出现了「verifiable ×× reward」的用法),词义的软化正在随配方一起扩散。
第一层同源:训练奖励和评测分数是同一个函数调用。§3.1 原文:「DeepSeek-V3 is used as the default sentient agent during both training and evaluation」——训练时发奖励的模拟用户和最后算出 79.2 分的模拟用户,是同一个模型(V3-1226)+ 同一套附录 E.1 的打分模板。这不是「训练环境模仿了评测环境」,是工程实现上就是同一个东西。
第二层同源:评测基准和训练方法是同一个团队。Sentient Benchmark 来自 SAGE 论文(arXiv 2505.02847)——交叉核对两篇署名:作者重叠至少 10 人,核心团队完全一致(都是腾讯混元 Digital Human)。完整链条:同一团队设计了打分方法(SAGE)→ 自己验证了它的心理学效度 → 把它搬进训练循环(RLVER)→ 用它算出头条数字。没有任何一步经过独立第三方。
第三层:效度背书本身很薄。RLVER 说情绪分「与 Barrett-Lennard 关系量表强相关」,全文唯一出处是引用 SAGE 的一句话;查 SAGE 摘要:那是 100 个场景的一次相关性检验,同团队自己做的,未见第三方复现。RLVER 没有补充任何验证,直接继承。
要公平记上的一笔:训练集(500 场景)和测试集(100 场景)实例确实不重叠,不是最粗暴的数据泄漏——但两者是同一个分布生成器(同一套人设库、隐藏意图库、生成模板)的两次采样。「实例不同」回答不了「出了这个模拟器家族还灵不灵」。
全文 41 页零真人评估。所有评测轴——主分数、闲聊泛化、五维能力雷达、策略贡献分析、社会认知坐标——全部由 LLM 产出,通读全文(含附录)没有任何人类评分员、用户研究或临床评估。更值得注意的是,论文把「不需要人类标注」当卖点写进结论(「without costly human annotation」)——当省掉的恰好是「检验这套自动打分是否可信」所必需的那一步时,把它当纯优点讲,就是把未验证的假设包装成已解决的问题。同期对照:TherapyGym(arXiv 2603.18008)专门造了 1270 条持证临床医师评分来校准自己的 LLM 判卷——说明这一步可行,只是 RLVER 没做。
含金量最高的外部证据:《Can You Break RLVER?》(arXiv 2605.07138,2026-05)直接用 RLVER 发布的真实 checkpoint,构造六类对抗场景(用户煤气灯、升级施压、索要无条件认同——都是 SAGE 假设里不会出现的情况),并把「总分」和「情绪状态追踪」拆开算。结果:RLVER 训练版在总分上大幅超过未训练基座(0.963 vs 0.761,p<0.001,零对话崩溃),但情绪一致性分数(ECS)与未训练基座无统计显著差异(p=0.650)——原文的措辞是「行为/易读性解离」(behavioral/legibility dissociation):RL 学会的是产出让分数上涨的行为,不是更准确的状态追踪。这几乎是「偏差换了藏身处」批评的一次直接实证。
「偏差换了藏身处」这个批评,论文自己有辩护吗? 逐页读完的答案:没有正面辩护。唯一相关的一段防的是另一个问题(用扩大人格库多样性防「用户偏好同质化」)——但一百个人设如果都是同一个 DeepSeek-V3 换装扮演,裁判的系统性偏好只会被平均掉表面噪音,不会被消除。全文没有「换一个判卷模型,79.2 会不会显著变化」的消融。
方向是真的:把验证做得更结构化(固定流程、可审计、多步推理),确实抬高了讨好的成本——训练初期打分机制就能识别「看起来像共情但没做功」的话术不给奖励,几种常见捷径(套话、灌水、堆建议)都被抗住了。相比一个黑箱标量奖励模型,这是实打实的进步。图⑫卡5 记录的整个「12 个月小簇」(MICA、RLFF-ESC、Echo-N1、CTC-GRPO)都在这个方向上迭代,且效果持续在涨。
教训一:「可讨好性」不随结构化消失,只是变贵。裁判仍是 LLM,第三方复测已经抓到解离(满意度涨、状态追踪平)。用图⑫的语言:这条路线产出的是「更贵更难骗的裁判」,不是执行器——unit test 那种「与被评者解耦的客观真值」在这个配方里结构性地不存在。
教训二:验证器自己成了需要调校的对象。挑战版模拟器实验证明训练效果对模拟用户的设计极度敏感——这意味着这个「执行器」不是造好就能跑的,它需要持续的人工校准,而校准的标准又回到了「谁来判断模拟用户设计得对不对」——验证的无穷回归只是被推后了一层。
对 Robin 对照层的意义(图⑫卡10 展开):RLVER 用一个 LLM 扮演的模拟用户闭环,BOC 用一个真人的真实反馈闭环——同样的拓扑,关键差异在裁决端是否可被被评者的分布覆盖。RLVER 的困境反过来照亮了 n=1 人肉执行器的价值和它的死穴:不可讨好是真的,不可规模化也是真的。