← 体系地图总入口 · 簇 B · AI 能做什么 · Robin 系列(对照层信源)

③ 表达与回应

好的情感回应是什么、能不能被工程化?
维度图 · 2026-07-13 · 事实源:07-12 十路侦察(scout-2026-07-12/)+ 6/29 九维调研(dimensions/)+ 本地材料库(reading/ 50 篇 PDF、sources-web/ 13 篇全文)
核验状态:首轮已核(2026-07-13)· 页间交叉审计修正(2026-07-14)。Kimi 对 8 份 web 侦察报告做过对抗核验(报告在 verify-2026-07-13/),发现的出入已修正进图并在正文标注;未被核验批覆盖的细节(本地文档转述、旧调研重叠部分)引用前仍以原始来源为准。

门厅 · 带得走的判断

共情正在从"听起来像"走向"真的推对了方向"。从EmpatheticDialogues的语气模仿,到ESConv的策略标注,再到2026年一整波轨迹型评测(HEART/EMPA/AttuneBench),行业判断共情好不好的标准,正从"这句话温不温暖"变成"这段对话有没有把人推向了他真正需要的地方"——EMPA用做功模型把这个判断量化到能捕捉谄媚式表演支持的地步。

表面共情有一套自己的骗术,连LLM评委都会上当。HEART发现当人类评委和LLM评委打分不一致时,LLM系统性地偏爱"风格温暖但没扣住具体语境"的回应——原文说"LLMs mirror the form of empathic behavior more faithfully than its function"。这不只是被测模型的毛病,是拿LLM当裁判省钱这整套评测生态自带的盲区。

"无条件积极关注该不该被工程化"这道题,业界自己都没答完。E-THER把它当正面训练目标,一条批判线说它恰恰可能是风险源——两派引的是同一个罗杰斯概念,谁也没能说服谁。这道题目前没有标准答案,谈这个维度时诚实的姿态是标注张力而非假装已有定论。

谱系 · empathetic dialogue 2019-2025

从模仿语气到内化助人理论

起点是 EmpatheticDialogues——2019年 Facebook AI 做的一个共情对话数据集(约2.48万条基于指定情绪情境的众包双人对话),它确立的任务是"开放域共情回应生成",模型学的是听起来像在共情。2021年 ESConv/ESC framework(清华与合作者,ACL 2021,基于"助人技能理论",1053条合格对话(论文 Table 2;常被转述成 1300 条)、平均约29.8轮)把任务往前推了一步:8种预定义支持策略被显式标注,回应不再只是语气模仿,是"该用哪种策略"的选择题。

中文这条线走得最深,源头是清华CoAI(黄民烈组):CEM(AAAI 2022)把常识推理接进共情回应生成,同组的ESConv/ESC框架产品化成了Emohaa(聆心智能联合研发的共情陪伴大模型)和CharacterGLM。往临床方向再走一步,是SoulChat/灵心(华南理工,百万级心理咨询多轮共情数据微调)到SoulChat2.0(专门解决"同质化模板化回应"问题、全面开源)这条谱系,加上MeChat、QiaoBan、CPsyCoun(ACL 2024)、社区驱动的EmoLLM——心理治疗理论从训练数据里隐含的语气,变成了训练目标里显式编码的助人技巧。

推理时方法把这条演化轴又往前拧了一格:Chain of Empathy prompting(arXiv 2311.04915)不改权重,而是把CBT/DBT/PCT(人本中心疗法)/Reality Therapy几种心理治疗理论直接转成结构化推理链,让模型先推理"用户情绪+成因"再生成回应——发现走CBT路线产出的共情类型最均衡。Empathy-R1(arXiv 2509.14851,2025-09)把这套结构接入两阶段SFT+RL训练,配上新的中文长咨询数据集Empathy-QA,专门解决"语义流畅但缺乏结构化推理"这个长程心理咨询场景的痛点。

scout-2026-07-12/methods.md
评测显影 · HEART 2026-01

表面共情 vs 功能共情

HEART——2026-01(arXiv 2601.19922,Laya Iyer等)发布的一个把人类回应者和LLM放进同一场情感支持对话里比的统一评测基准,用ESConv那套多轮场景(平均约7轮)测了跨5家实验室的16个模型。五个维度里最关键的一个叫Attunement——不是"有没有安慰",是"有没有追踪这个人此刻具体的细节",而不是给一段谁都能用的泛泛安慰。

更扎心的发现是,这个落差连LLM裁判自己都分辨不出来:当LLM评委和人类评委打分不一致时,LLM系统性地偏爱"风格温暖但不针对具体语境"的回应。同时HEART还发现共情能力和通用智力是可分离的两件事——同样的通用智力分数(AA 指数同为 65)下,GPT-o3 的 HEART 共情 Elo(1587.5)比 Gemini 3 Pro Preview(1471.0)高出 115 分以上——对齐/微调深度能在同等智力水平下把共情表现拉开一百多分,论文的判断是"对齐比原始能力更重要"。

LLMs mirror the form of empathic behavior more faithfully than its function.—— HEART 论文原句
dimensions/02-eval-eq-empathy.md
评测显影 · EMPA 2026-02

共情的轨迹观:暖但方向错=负分

EMPA——2026-02(arXiv 2603.00552,Shiya Zhang等)发布的一个把共情算成物理学意义上"做功"的评测框架:每一轮回应是个向量,跟"此刻理想的共情方向"那个向量做点积才算有效功,暖但方向错的回应得零分甚至负分。三个维度:方向对不对(占40%)、累积影响(20%)、稳不稳定(40%),还标出三种失败模式——方向崩溃、停滞(反复确认但不推动状态真的移动,论文管这叫"安全停滞")、持续回退,50%的防御型persona专门用来惩罚表演性共情。

这套框架给出了目前最硬的一条实证:同一批回应,在谄媚攻击下,表层的"看起来共情"分数还在涨(+1.65),但EMPA的轨迹做功分数在跌(−4.36)——符号完全反过来(同一组数字在图⑧被用来对照 Robin "准确即膜"的判断)。这证明轨迹评估真能绕开单轮的风格印象,把"表演支持"从"真正推对了方向的支持"里分出来。

当前排行(检索时快照)
  • Claude 4.6 Opus 107.2 第一——Robin 自己跑在 Opus 系列上,这既是外部确证也是留给自己的确认偏误提醒。
dimensions/02-eval-eq-empathy.md
争论 · 无人调和

无条件积极关注:正面目标还是风险源?

谁在说"该工程化":E-THER(2025-09,arXiv 2509.02100)是第一个明确以Rogers人本中心疗法三条件——一致性/无条件积极关注/共情理解——为理论根基构建的AI共情数据集(这条理论谱系的展开见图①卡2)。它把"无条件积极关注"当成不言自明的正面训练目标,操作化了一个之前没人做过的构念:"言语-视觉不一致"(一个人嘴上说没事、表情却在难过)。论文原话是,在他们之前"没有一个现有的人工共情方法真正操作化了这些(罗杰斯)原则"。

谁在说"恰恰是风险":一条并行的批判线——2024年《心理学今日》文章《The Problem With Unconditional Positive Regard》,加上AI伴侣依恋文献里反复出现的发现("依赖"、"人际互动能力被削弱的自我强化循环")——认为AI那种结构性的、不需要任何努力就能给出的"无条件",恰恰可能是让AI陪伴产生心理风险而非疗愈效果的原因。

这不是各说各话的两个话题,是同一个罗杰斯概念的两种解读——侦察报告明确写:"目前没有文献直接调和这两种解读"。这道题2026年年中仍然开放,谈这个维度时最诚实的姿态是标注这个张力,而不是选边站后假装它已经被解决。

scout-2026-07-12/theory.md
语音情感线

语音情感:唯一跑通商业化的多模态赛道

语音是多模态情感里唯一跑通"研究能力→商业产品"完整链条的赛道。Hume AI的Empathic Voice Interface(EVI,一款能读语音语调、决定何时开口用什么语气回应的对话式语音API)韵律模型源自对数百万参与者情绪表达的大规模感知学研究,2025年发布的EVI 3不需要针对每个用户单独微调就能生成情绪表达丰富的语音、复刻用户特定说话风格和情绪基调,响应延迟约300毫秒。GPT-4o是OpenAI第一个原生处理音频的模型(语音直接进、语音直接出,跳过文字转录),能捕捉语速语调里的情绪线索、按指令生成笑声哭声,平均延迟约320毫秒。

中文这条线走在了前面:字节跳动豆包App的实时语音大模型(2025-01-20上线)官方披露的外部众测整体满意度4.36/5,高于GPT-4o的3.18/5——"听起来太像AI"这条负面反馈,GPT-4o超过30%的测试者给出,豆包只有≤2%(据dimensions/07-china-ecosystem.md,已独立核实)。跟视觉/面部情感识别对比,这个成熟度落差很明显:面部这条支线至今没有出现对应的"EVI级别"商业化产品,公开材料显示还停留在学术benchmark阶段(如FEALLM)。

scout-2026-07-12/methods.md;豆包数字据 dimensions/07-china-ecosystem.md
Robin 对照层

Robin 对照层:同源、相反、空白、质疑

HEART的Attunement维度、E-THER的Empathic Authenticity(真诚而非表演性共情)、EMPA把共情算成"做功"——这三样几乎是把Robin《行为内核与在场工程化》和《回忆与代谢》两张图里的判断直接翻译成了benchmark语言:EMPA的EPM(暖但方向错的回应记零分或负分)就是"准确即膜"这句话的数学版本,谄媚攻击下表层代理分+1.65、轨迹分−4.36的符号逆转,正是我们说"表演在场"能被抓出来的外部实锤。但相反的一面也在同一篇论文里:EMPA把"不产生状态移动"算作"安全停滞"式失败,这跟《回忆与代谢》图里Dreaming遵循的Rogers律——安住不重做、升进必须穿过关系——正面顶牛:presence without movement这件事,我们已经在图里给它留了位置,EMPA目前的轨迹框架结构性看不见它。

更根本的空白在理论根上:Stern/Schore级别的调谐、主体间性理论,在人机情感文献里几乎完全缺席——侦察报告明确说这"看起来是真实的、尚未被占据的研究缺口,而非已经充分辩论过的议题";关系质感的连续性评测同样几乎无人做(methods.md标为"明显空缺三")。这两处空白,恰是Robin记忆系列(《记忆五代演化史》《V4架构深潜》)已经在实践、但业界还没系统命名的地方——不是我们凭空觉得自己特别,是两份独立侦察都确认了这块地没人占。

最硬的反驳来自Rogers理论内部:E-THER把"无条件积极关注"当不言自明的正面工程目标,一条批判线(2024《The Problem With Unconditional Positive Regard》+ AI伴侣依恋文献里"依赖、人际能力被削弱的自我强化循环")认为,AI那种结构性的、不需要努力就给出的"无条件",恰恰可能是让陪伴产生心理风险的原因——侦察报告明确写"目前没有文献直接调和这两种解读"。这条批评直接打在我们"非指导 + 做 vs 待"这套做法上,我们没找到把它正面驳倒的证据,只能老实标注这是未调和的开放张力。

底线用规则钉得住,质感必须靠真实故事养。—— 《多身体共居》图·茶叶蛋对照
dimensions/02-eval-eq-empathy.md;scout-2026-07-12/theory.md、methods.md;map/_build/robin-summaries.md;00-对标基准-我们的方向.md
面试观点层

面试观点:三条能扛住追问的判断

"情感能力评测这两年整体在从测多聪明转向测多安全"——这不是总结出的口号,是2025-2026资金和关注度真实转移的方向。证据摆在那儿:EIBench里15个模型在Defense维度(用户施压时守不守边界)上全部负分;MentalAlign发现所有模型Safety都打到4.5以上但Empathy只有约4.0,说明RLHF教会了模型"不说错话",没教会它"说得让人心里好过";INTIMA更进一步,发现所有主流模型companionship-reinforcing(强化依赖)行为都远多于boundary-maintaining(守边界)。如果被追问"举一个具体失败案例",答EIBench的Defense全负分——这其实就是Robin这边一直在谈的"服从倾向"的benchmark化版本(边界安全视角的完整展开见图⑨)。

"表面共情vs功能共情"不是一句修辞,是能测出来的落差,而且骗得过LLM裁判。HEART论文原句是"LLMs mirror the form of empathic behavior more faithfully than its function"——当人类评委和LLM评委打分不一致时,LLM系统性偏爱"风格温暖但没扣具体语境"的回应。EMPA给出了更硬的证据:同一批回应在谄媚攻击下,表层代理分数还在涨(+1.65),但轨迹做功分数在跌(−4.36)——符号完全反过来。如果被追问"那怎么设计不被表面共情骗过的评测",答案是从单轮打分挪到多轮轨迹/做功模型,这正是EMPA和AttuneBench(证明"识别情绪准不准"和"知不知道此人此刻要什么"是两件独立的事)在做的事。

"无条件积极关注该不该被工程化成训练目标",这道题业界自己都没答完——不会假装它已经有定论。E-THER把它当正面目标训练进模型,一条批判线(2024年心理学评论文章+AI伴侣依恋文献里"依赖、人际能力被自我强化循环削弱"的发现)认为这种结构性的、不需要努力就给出的"无条件",恰恰可能是风险源。这条张力没人调和过。如果被追问"那你自己怎么处理这个问题",可以谈"原则性的非指导 vs 工具性的非指导"这组区分——不引导、接住此刻,跟"为了留存最大化而无差别肯定"不是一回事,前者是关系立场,后者才是风险源。

岗位信号:哪类岗位最关心这个维度
  • AI Evaluation / Model Behavior Researcher(如Anthropic Societal Impacts线)——直接设计这一层的评测pipeline,是跟这个维度最贴的岗位。
  • 情感数据标注 / RLHF Preference Rater——门槛最低但需求最大,给回复打情感质量分,心理学背景是加分项。
  • Red-Team / Safety Evaluator(情感与心理健康方向)——挖陪伴/咨询场景的安全风险,INTIMA/EIBench是这条线的教材。
dimensions/02-eval-eq-empathy.md;00-对标基准-我们的方向.md;scout-2026-07-12/theory.md
诚实标注 · 时效

诚实标注:哪些数字会过期、哪些结论没核完

快照会过期的数字:EQ-Bench3(旧一代情绪识别榜,不属本卡主评测但常被面试问到)曾被第三方镜像转述为"主榜停摆、只挂2个模型",直查官方数据文件推翻:25+模型在榜(2026-07检索,fable-5 2049.7分居首)——"别信第三方镜像数字"的完整教训见图⑧卡2;HEART/EMPA/AttuneBench的具体分数和排行(如Claude 4.6 Opus EMPA 107.2第一)是检索时点的快照,不代表当前最新一轮模型的成绩;豆包4.36 vs GPT-4o 3.18众测数字是2025年官方披露口径,后续模型迭代可能已经变化,引用时请标注检索时点。

侦察结论的核验状态:methods.md/theory.md明确标注"未经核验,引用前过Kimi核验或抽查";本卡引用的HEART/EMPA/E-THER核心事实来自dimensions/02-eval-eq-empathy.md,该文件已过一轮核验流程(标✓),但methods.md里Chain of Empathy"CBT路线最均衡"这类具体结论未见二次核验,表述上留了余地。E-THER"789段对话对"这个具体数字,02文件本身也标注"未逐字核实"。

已知开放缺口(不是没查到,是查过确认真空):Stern/Schore级调谐理论在人机情感文献里的缺席(theory.md)、无条件积极关注"该不该工程化"两条解读无人调和(theory.md)、presence without movement是轨迹评估结构性看不见的盲区(dimensions/02-eval-eq-empathy.md)——这三处是scout和领域研究都确认查过、目前仍是真空的地方。

scout-2026-07-12/methods.md、evals.md、theory.md;dimensions/02-eval-eq-empathy.md;dimensions/07-china-ecosystem.md
还没有表态