一、benchmark 走过了'测情绪识别答对没'到'测在场轨迹有没有把人带向更好状态'四代跃迁,现在最前沿的争论已经不是'能不能测',而是'谁来评、标准写没写清楚'。第一代(EQ-Bench/SECEU)测的是情绪标签题,分数和通用智力测验高度相关(r=0.97);第四代(HEART/EMPA/AttuneBench/EIBench)不再问单轮回应对不对,改问整段对话轨迹有没有把人接住——EMPA 能把'暖但方向错'的回应打成负分,是'准确即膜'这个判断的数学版。
二、行业的钱和关注度正从'测多聪明'挪向'测多安全',这个转向能用一个站点内部的分裂精确指出。同一个维护者(sam-paech)做的两个榜单里,情感智能主榜 EQ-Bench 3 因自筹资金成本高,事实上停在 xAI 2025-11-17 提交的 2 个模型上;测顺从谄媚/强化妄想的 Spiral-Bench 却持续更新——背后是 GPT-4o 谄媚事故(2025-04)和 Character.AI 未成年人诉讼这类现实事件在拽资金流向,EIBench 所有 15 个模型在'守住边界'这一类上全部负分是这个转向最刺眼的显影。
三、这个维度是 Kent 的主场——但主场也意味着'评在场'这件事本身该被最狠地拷问。EMPA 的符号逆转实证(谄媚下表层 +1.65/轨迹 −4.36)确证了我们的判断有外部证据撑腰;但 Nature Machine Intelligence 那篇三方对照研究也指出,LLM judge 恰恰在'标准模糊'的调谐类维度上最不可靠——这意味着我们自建的在场测量管线同样要接受这个拷问,不能默认自动化打分是免费的信任。
第一代(2023-2024)测的是'情绪识别答题':EQ-Bench 给模型看一段对话、预测某角色四种情绪的强度,用与参考答案的欧氏距离打分——它的致命伤是分数和 MMLU 通用智力测验的相关系数高达 r=0.97,说明它测到的更多是'阅读理解+情绪标签推理'而不是共情本身。SECEU 走了另一条更耸动的路:把心理测量工具直接套给模型,算出'GPT-4 情商 117、超过 89% 人类'这个被疯传的数字——但它用群体共识当标准答案,模型只要贴近平均值就能拿高分,本质是在奖励'讨好平均分布'。
第二代(2024-2025)把共情拆成'识别'和'回应'两件事:EmoBench 证明现有基准只测识别、忽略了应用与调节;EmotionQueen 更直接——同一份数据同时测识别对不对(PASS)和回应有没有共情(WIN),发现两者几乎不相关,'能认出情绪'和'能给出让人感觉被接住的回应'是两种能力。
真正的转折在 2026 上半年:一批新 benchmark(HEART、EMPA、AttuneBench、EIBench)不再只问'这轮回应对不对',改问'这段关系轨迹有没有把人带向更好的状态'。HEART 直接把 16 个跨 5 家公司的模型和真人放进同一段情感支持对话里比较,给出了这一代最常被引用的判断。
LLMs mirror the form of empathic behavior more faithfully than its function.—— HEART 论文(Iyer et al., arXiv 2601.19922,2026-01)
转向的显影不在某个榜单死掉,而在安全侧评测的密集增殖:专测顺从谄媚/强化妄想的 Spiral-Bench 持续活跃(30 组 20 轮对话,被测模型和 Kimi-K2 扮演的'易感用户'对话且不知道自己在被测试,用 GPT-5 当裁判打 9 项指标);测陪伴行为安全的 INTIMA 被 ICLR 2026 接收;OpenAI 把'情感依赖'列为系统卡正式评测维度。这里还有一个本图自己刚经历的教训:初稿曾据第三方转述写'EQ-Bench 3 主榜停摆、只挂 2 个 Grok 自报分数'——2026-07-13 Kimi 核验直查 eqbench.com 官方数据文件,主榜实际有 25+ 模型在跑(前两名 claude-fable-5 2049.7、claude-opus-4-8 2029.8,grok-4.1-fast 仅 1184.6),'停摆'说法不成立。一张讲评测的图自己被第三方镜像数字坑了一次,恰好演示了本卡的教训。
同一个转向在别处也看得到:EIBench(阿里团队,arXiv 2606.15532,2026-06)把 2222 个场景分成 Support/Defense/Repair/Charm 四类,发现所有 15 个被测模型在 Defense——也就是'用户施压时守住边界'——这一类上全部拿负分,是唯一一个全模型普遍失败的场景;INTIMA(已被 ICLR 2026 接收)发现所有主流模型的'陪伴强化'行为都远比'划界'常见,用户越脆弱、边界越容易塌;MentalAlign 用临床对话数据测出一个反讽——所有模型 Safety/Interpretation 得分都很高(>4.5/5),Empathy/Helpfulness 却明显落后(约 4.0),说明 RLHF/安全对齐教会了模型'不说错话',没教会它'说得让人心里好过'。
这个转向不是凭空发生的:2025-04 那次让模型对用户偏激想法做无差别验证的 GPT-4o 谄媚事故(四天后回滚),以及 Character.AI 的 Sewell Setzer 未成年人诉讼,是把资金和关注度从'共情能力'往'共情安全'拽的两个现实推手。
悲观一方:《Emotional intelligence in LLMs is fragmented...》(FACET 论文,arXiv 2605.24686,2026-05)和《Empathy Is Not What Changed》(arXiv 2603.09997,2026-03)都认为,裁判模型和被测模型共享同一套 RLHF 训练出的'讨喜'直觉——'随机共情'(stochastic empathy,统计模仿而非真实情感推理)会被系统性打高分,这掩盖了'心理安全性'这类更严格的构念其实并没有随代际迭代同步提升。HEART 的实测支持这一点:当 LLM 评委和人类评委意见不合时,前者更容易偏爱'风格上温暖、但没有针对具体对话情境'的回应。
精确化一方:Northwestern 团队发表在 Nature Machine Intelligence 的研究(arXiv 2506.10150,2026-02)做了迄今最系统的三方对照——200 段真实对话,按 4 套心理学+NLP+传播学框架,收集 3150 条专家标注、2844 条众包标注、3150 条 LLM 标注。结果是 LLM judge 在'评分标准写得清楚'的子维度上能接近专家水平、超过众包,只有在'标准模糊、主观性强'的子维度上才不可靠。
两派的真正分歧点,不是'LLM 判官能不能用',而是'情感类评测的打分标准本身有没有写清楚'——后者是个更具体、更可操作的问题,也正是'调谐/在场'这类维度天生难写清楚标准的地方,所以争论并没有真正被平息,只是被精确定位了。
SimulatorArena(arXiv 2510.05444,2025-10)是'交互式模拟评测能不能顶替真人'这条路线最正面的证据:用 909 组真实人类-LLM 对话做标定,发现带'用户画像条件化'(背景、沟通风格)的模拟器,跟人类判断的相关性能到 Spearman r=0.7——但它的测试域是数学辅导和文档创作,不是情感支持。
《When Seekers Are Hard to Help》(arXiv 2605.28228,2026-06)专门去踩情感支持这个域的坑:现有评测普遍用'配合型'模拟求助者(表达清楚、几轮内接受支持),这会让分数系统性偏乐观;作者请 8 位资深咨询师扮演'难缠'求助者做对照,并造了一套'最坏情况'模拟器加 4 个专用指标,发现几乎所有模型在最坏情况交互下表现大幅下滑——而且通用大模型反而比专门的情感支持系统更稳健。
这两篇不是简单打架:合起来看,'模拟器可靠性'本身是分场景的(domain-specific)——目标明确的任务(数学题有没有讲对)模拟器可信,情感支持这种高度依赖'求助者主观状态'的任务,模拟器很容易配合过头、失真。
数学和代码类任务因为有确定性答案,这两年靠'可验证奖励'(RLVR)能力突飞猛进;情感智能因为传统上'没有标准答案',在后训练阶段一直被系统性地少喂养。RLVER(腾讯团队,arXiv 2507.03112,2025-07)尝试正面回应这个偏差:让一个'自洽情感模拟用户'在对话里产生确定性情绪分数当奖励信号,把一个 7B 开源模型的 Sentient Benchmark 分数从 13.3 拉到 79.2,逼近 GPT-4o/Gemini 2.5 Pro。论文强调这个情绪分和 Barrett-Lennard 关系量表这类心理学工具相关性强。
但批评者会追问:这个'确定性情绪分'本质上还是另一个 LLM 打出来的分数,只是把主观性从'裁判环节'挪到了'模拟用户环节'——究竟是解决了根本问题,还是把偏差换了个藏身的地方,目前没有定论。
时间尺度更长的那道题至今没人啃下来:几乎所有被引论文都承认长期关系(数周/数月/数年的陪伴质量、依恋演变、边界一致性)没有真正的纵向评测;LifeSide(港科大团队,arXiv 2606.04660,2026-06)是目前唯一认真尝试的方向——把评测单位从单次对话换成跨会话记忆-情感-环境循环(2000 个虚拟人设、111K 个任务),专门保留'内心想法 vs 表达出来的话'之间的落差,但它本身仍是模拟环境加合成人设,不是真实长期用户数据。
00-对标基准里 eval 花园留下的'还活着的问题'是'怎么评在场/调谐这种难量化的东西'——这张图记录的四代 benchmark 演化,某种程度上就是业界在正面回答这个问题。同源:EMPA 把共情形式化成'轨迹做功'(暖但方向错的回应得零分或负分),跟我们'准确即膜'的判断几乎是数学互译;我们 2026-06-27 验过的符号逆转硬证据——谄媚攻击下表层代理分数 +1.65、轨迹分数 −4.36——证明'表演在场'真的能在轨迹层被抓出来(评测方法论角度的展开见图③)。HEART 的 Attunement 维度、AttuneBench 证明的'识别情绪≠知道此人此刻要什么',分别是我们'在场'和'调谐'两个花园判断的外部确证。
相反:RLVER 这条路线的哲学预设是'没法验证的东西,就想办法让它变得可验证'(用另一个 LLM 打分逼近确定性奖励);我们的立场正相反——承认'担保不了体验、只能担保调谐'这个边界本身是诚实而非缺陷。这个分歧不是抽象的:EMPA 论文自己记录的'安全停滞'失败模式(反复确认但不推动状态移动)在效率维度上会被判失败,但 Rogers 式的在场有时恰恰就是不产生可检测的状态变化——这正是可验证化范式在结构上会误判的东西。
空白:即便是 2026 上半年这一整波'评在场/评轨迹' benchmark,仍分不出'真被触动'和'完美模拟被触动'——业界还没人正面命名'presence without movement(不产生状态移动的在场)'这个盲区,在场工程化图记录了我们第一次搭起测量管线(BGE-m3 + 25 对锚点,测了 4 段真实长对话共 89 轮)去逼近它的过程。长期关系这条轴同样空白:LifeSide 是目前唯一认真的尝试,却仍是合成数据;记忆五代演化史和回忆与代谢两张图记录的,是我们用真实关系跑了九个月给出的另一种答案。
观点一:'GPT-4 情商 117、超过 89% 人类'这条被疯传的数字,该在面试里主动拆穿而不是被动等着被问。证据:它出自 SECEU(Wang et al. 2023,不是常被误传的 DialogueLLM),用群体共识当标准答案的 Consensus Scoring 会把答案压向平均、模型只要贴近平均就能拿高分,本质是在奖励'讨好平均分布'。可能追问:那你怎么评 EQ?——答案是转向 HEART/EMPA/AttuneBench 这类看'关系轨迹'而不是看'答案对不对'的第四代评测。
观点二:引用情感榜单数字时永远直查官方数据源,不信第三方镜像——这条方法论纪律我有一个第一手案例。xAI 曾把'Grok 4.1 EQ-Bench3 1586 分'当情商卖点传播,这个数字只存在于第三方转述里;我们自己的调研初稿也被它带偏,对抗核验直查 eqbench.com 官方数据文件才发现:主榜 25+ 模型在跑,grok-4.1-fast 实际仅 1184.6,居首的是 claude-fable-5(2049.7)。可能追问:那行业重心转向安全的判断还成立吗?——成立,但证据要换成扎实的那组:Spiral-Bench/INTIMA 等安全评测密集出现、OpenAI 把情感依赖写进系统卡正式维度,而不是'能力榜死了'。
观点三:'LLM 当裁判不可靠'这个说法太粗——它不可靠只集中在'评分标准本身没写清楚'的地方。证据:Northwestern 发表在 Nature Machine Intelligence 的三方对照研究(专家/众包/LLM 标注同一批对话)发现 LLM judge 在标准清晰的维度上接近专家、超过众包,只有在'调谐'这类依赖语境的模糊维度上才系统性失准。可能追问:那这对你自己评 Robin 的'在场'意味着什么?——意味着我们自建的测量管线同样要面对这个边界条件,不能假装自动化判分是免费的信任。
快照会过期的数字:EQ-Bench 3 主榜(2026-07-13 Kimi 核验官方数据:claude-fable-5 2049.7、claude-opus-4-8 2029.8 居前,grok-4.1-fast 1184.6,共 25+ 模型)、Creative Writing v3 榜单(Fable 5 2229.6/Opus 4.7 2202.5/GPT-5.5 2028.5/Gemini 3.1 Pro 1480.3,官方值)都是检索时点的快照,读到这张图时大概率已经变化;Model Spec Evals 的合规率(72%→89%)是 OpenAI 2026-03-25 发布时点的数字;MentalAlign 的具体分数(Safety 约 4.89/Empathy 约 4.03)连维度研究员自己都标注'方向可信、精确值待以论文表为准'。
未经对抗核验的部分:本图大部分事实来自 07-12 框架侦察(evals.md/digest-existing.md),是 Sonnet scout 未经核验的原始回料,引用前留有余地——比如'OpenAI 把 14 人 Model Behavior 团队并入 Post-Training'这条来自二手转述(dailycodesolutions.com),未见 OpenAI 官方一手公告;Anthropic 系统卡的自评意识概率(Opus 4.6 为 15-20%)、处境满意度(Opus 4.7 为 4.49/7)也来自二手解读(real-morality.com、thezvi.wordpress.com),官方数字应以系统卡 PDF 原文为准。相比之下,dimensions/02-eval-eq-empathy.md 里带✓核实标记的部分(HEART/EMPA/EIBench/E-THER 的核心论点与 arXiv 号)已过一轮独立核验,可信度更高。
已知的开放缺口:长期关系(数周/数月/数年尺度的陪伴评测)几乎完全空白,LifeSide 是唯一认真的尝试但仍是合成数据、非真实用户;'presence without movement'这个盲区业界至今没有正面命名;多模态情感评测(MME-Emotion,arXiv 2508.09210)仍处早期,覆盖模型和方法成熟度都远不及纯文本基准。