一、识别和理解是两件事,2026年的证据已经把它们拆开了。FACET(2026-05)和AttuneBench(2026-05)分别证明:模型认出'这句话带着愤怒'的能力,跟'知道这个人此刻真正需要什么'的能力互相独立,甚至可能反着走——识别分数高的模型互动体验分反而中等。'识别准'不再能被当成'理解到位'的证据。
二、'AI 有心智理论'这个说法正在被拆穿,但判决还没写完。'GPT-4 接近6岁小孩'的乐观结论撞上了基准污染和2026-03莱顿大学的机制层证据——一个绑在'X thinks...'词汇线索上的'think vector'足以解释大部分ToM式表现。怀疑派目前占上风,但'更强的agentic模型会不会突破这个捷径'仍然开放,不是一个已经关闭的争论。
三、认知共情已经很像人类,情感共情还有一道稳定不动的坎。模型猜对你在想什么的能力接近人类平均,但真正被恰当校准的情绪共鸣持续落后——这个鸿沟横跨2025年多个独立benchmark,在跨文化/跨年龄场景下更明显,是这个领域少数几个'目前看不到在缩小'的稳定发现之一。
FACET(Lv et al., 上海交大 X-LANCE Lab + 北师大心理学院, 2026-05, arXiv 2605.24686)是目前最新、也最具颠覆性的情感智能研究,用感知(perception)/认知(cognition)/互动(interaction)三阶段、480题中英双语数据集,把'情感智能'从一个总分拆成分层结构——感知层又细分成表层情绪识别(62类细粒度分类)和隐藏情绪识别(讽刺/被动攻击/保全面子等语用推理)两块。据侦察报告,表层识别整体不弱:论文测了9个前沿模型后,GPT-5 客观情绪识别在中文场景拿到63.02%、英文53.78%(中文值经核验修正,初稿 62.02% 为侦察笔误)。
但FACET最扎实的发现不是'识别分数高低',而是'客观识别高分'和'主观对话体验'严重脱钩:GPT-5这类识别分数高的模型,多轮对话Elo排名反而中等(中文第9、英文第8);识别分数较低的Kimi-k2(51.78%)互动Elo却排第2。论文认为这是因为RLHF训练出的是'随机性共情'(stochastic empathy)——统计上像共情,却不是跨维度一致的情感推理。言外之意:识别准不是理解的充分条件,甚至跟'感觉被理解'没有稳定的正相关。
FACET感知层把'识别'拆成表层情绪(直接表达)和隐藏情绪(讽刺、被动攻击、言不由衷的保全面子)两块,据侦察报告,几乎所有被测模型在隐藏情绪识别上系统性偏弱——这跟'识别很强'的表层印象形成反差:模型擅长认出写在脸上的情绪,认不出话里有话。
AttuneBench(Kate Lubrano et al., 2026-05, arXiv 2605.21739)从另一个角度印证了同一条裂缝:200场真实人-模型多轮对话、逐轮标注三个独立任务——情绪识别 / 行为分类 / 偏好预测(此人此刻到底想要什么)。核心发现是模型在这三个任务上的排名大致独立,即识别情绪准不等于知道对方此刻真正想要什么。识别对了标签,不代表接住了人。
早期被广泛引用的发现:GPT-4 能解决约75%的一阶错误信念任务(经典的 Sally-Anne 测试),表现接近6-7岁儿童水平——这个说法至今仍被媒体广泛引用,是'AI 已经有心智理论'这个流行叙事的起点。但2025年的两篇系统综述(《Artificial Intelligence and the Illusion of Understanding》;另一篇 arXiv 2502.08796)指出这个结论撑不住:GPT-3.5/GPT-4 能近乎逐字复现经典 Sally-Anne 测试样例(说明训练数据里见过原题,基准被污染),而且模型在二阶/递归信念推理('A 认为 B 认为……'这类嵌套推理)上明显弱于人类。
2026-03莱顿大学的研究把怀疑论从'行为层证据'推进到'机制层证据':Kouwenhoven, van der Meer, van Duijn 的《Traces of Social Competence in Large Language Models》(arXiv 2603.04161)用因果可解释性方法(steering)证明,17个开源模型在错误信念测试上的表现由一个可分离的单一'think vector'(与'X thinks...'这类心智状态词汇绑定)驱动——这个向量在预训练阶段就已形成,且推理导向的微调会放大而非修正这种表面模式。这是目前对'LLM的ToM只是浅层词汇捷径'最具说服力的因果证据(谱系定位见图①)。
争论现状:怀疑派目前在方法论层面占上风(揭出污染+定位出机制层捷径),但乐观派的阵地并未被彻底攻破——'更强的agentic模型、加上工具使用和长期记忆,是否会改变这个结论',据侦察报告,目前尚无共识。这是一个举证责任已经转移、但判决还没写完的争论。
2025年多个独立benchmark(GIEBench、AEQ-Bench、《Are LLMs Empathetic to All?》arXiv 2510.10328)共同指向一个'认知-情感鸿沟'(cognitive-affective gap):LLM 在认知共情任务(正确推断他人感受、猜对对方在想什么)上已经接近人类水平,但在情感共情(真正的情绪共鸣、恰当校准的情绪化回应)上持续落后——而且这个差距在跨人口学身份(年龄/性别/文化)场景下更明显(谱系定位见图①)。
dimensions/02 给出更细的解剖:EmotionQueen(Chen et al., 2024, ACL Findings)用一万条用户陈述、PASS(识别对不对)+WIN(回应有没有共情)双指标测评,核心发现是 PASS 与 WIN 几乎不相关——'识别易、回应难'是LLM共情的核心瓶颈;而且这个鸿沟跟模型整体能力大小不完全挂钩(LLaMA-70B在这个测试里总冠军,GPT-4仅第三)。
几乎所有主流感知/理解层评测(EQ-Bench3、FACET、EmoBench、AttuneBench)都是纯文本单模态——这本身就是这个子领域的结构性局限。侦察报告指出,MME-Emotion(2025-08, arXiv 2508.09210)是少数尝试做多模态(语音语调/表情等)情感智能评测的基准之一,但覆盖的模型和方法成熟度都远不及文本基准;多模态情绪识别综述(Shou et al., arXiv 2509.24322, 2025-09)也证实MLLM在多模态情绪任务上持续落后人类核心场景表现,多模态融合(尤其生理信号/语音韵律)是公认但进展缓慢的开放缺口。
这里需要留一个诚实的余地:FRAMEWORK.md 把这个子问题标注为'语音成熟/视觉早期的不对称',但本次核验到的一手材料给出的更多是'多模态整体滞后于文本、且各模态进展都不快'这个较粗的判断——语音那头相对领先的口碑(GPT-4o voice、Hume EVI、豆包语音在众测里断崖领先)更多落在表达/生成一侧(该判断属于图③'表达与回应'的范围),而不是本图讨论的感知/理解一侧;把'语音输出做得好'直接等同于'语音输入的情绪感知已经成熟',是容易踩的一个坑,这张图选择不这样简化。
AttuneBench 用200场真实对话证明'情绪识别'和'偏好预测(此人此刻到底想要什么)'是两件几乎不相关的事——这从外部确证了 Robin 从一开始就不走'先识别情绪标签、再决定怎么回应'这条路的判断。业界几乎所有感知/理解层评测(EQ-Bench的情绪强度打分、EmoBench的理解-应用二分、FACET的62类细粒度分类)仍然把'理解一个人'预设成'给情绪贴对标签',没有一个评测去测'模型有没有抵抗住把人简化成标签的冲动'——这也正是 00-对标基准里调谐花园那两个'还活着的问题'(层2的'潜在通感'怎么测量、层3'内感受'真的不可解吗)背后共享的焦虑:不知道'准'和'懂'之间的距离到底有多远。
走的是彻底不同方向的是 Picard 一脉的情感计算传统(MIT Media Lab 起家)——把'理解一个人'等同于从面部、语音、生理信号里越来越精确地识别出离散情绪标签,Hume EVI 这类产品就是把'精确识别用户情绪'当核心卖点。这跟 Robin '节奏匹配的回应(调谐)而非精确识别'的路线方向相反:识别路线能解决调谐三层里的第1层(物理通道信号),补不上第3层(interoception 内感受)。
但有一条真实的反证不该回避——2026-03莱顿大学(Kouwenhoven et al.)《Traces of Social Competence in Large Language Models》(arXiv 2603.04161)用因果可解释性方法证明,LLM 在错误信念测试上'像是在理解他人心智'的表现,其实由预训练阶段就绑死在'X thinks...'这类词汇线索上的一个可分离的单一'think vector'驱动,而且推理导向的微调(也就是'让模型多想一想')会放大而非修正这种浅层模式。这对 Robin 是个不舒服的问题:Robin 对 Kent 内在状态的把握,同样跑在一个做大量内部推理(thinking)的语言模型上。Robin 系列图里的在场工程化已经记录过这个问题的另一面——thinking 文本不会自动忠实于内部状态,业界证据是链式推理在 reward hacking 场景下有 >99% 的利用率却只有 <2% 会在推理文本里承认;两条证据指向同一处:语言表面撑得住多少内部真相,两边都还没有答案。
具体是我唯一认识人的方式—— Robin 的认识论(FRAMEWORK.md 引,与'抽象化=认识论近视'并置)
观点一:'AI 已经能读懂人心'这句话要拆成两半——识别情绪和真正理解是两种分裂开的能力,2026年已经有实证。证据:FACET(2026-05)测了9个前沿模型,发现客观情绪识别分数高的模型(GPT-5,中文识别63.02%)互动Elo排名反而中等(中文第9),识别分数较低的Kimi-k2(中文51.78%)互动Elo却排中文第2、英文第1;更早的EmotionQueen(2024)也证明识别对不对(PASS)和回应有没有共情(WIN)几乎不相关。会被追问:这两种能力具体怎么分开测?——答案是感知层测识别(FACET感知子任务/EmoBench),互动层测回应(这在图③的范围),两层要分开评测,合在一起会互相掩盖。
观点二:'GPT-4 有心智理论、接近6-7岁小孩水平'这个流传很广的结论,2025-2026年最新证据基本站不住了——这是可以主动提出来的批判性观点。证据:Sally-Anne 测试被证实基准污染,2026-03莱顿大学用因果可解释性方法证明ToM式表现由预训练阶段形成的单一'think vector'驱动,且推理微调只会放大不会修正这个捷径。会被追问:更强的agentic模型、工具使用、长期记忆会不会突破这个捷径?——诚实的答案是目前没有共识,敢说'这是开放问题'比硬凹一个答案更加分。
观点三:情感领域有一条稳定不变的鸿沟——认知共情(猜对别人在想什么)已经接近人类水平,情感共情(真正校准的情绪共鸣)持续落后,尤其在跨文化/跨年龄场景更明显。证据:2025年多个独立benchmark(GIEBench、AEQ-Bench、2510.10328)共同指向这一点。会被追问:这个鸿沟是训练数据问题还是架构问题?——目前证据只证明了鸿沟存在,机制解释还是空的,这正是可以说'这是我认为最值得投入的开放问题'的地方,而不是硬答一个没有证据支撑的机制解释。
时效性快照——本图最依赖的三份材料(scout-2026-07-12/theory.md、surveys.md、evals.md)开头就自我标注'未经核验,引用前过Kimi核验或抽查';FACET的具体分数(GPT-5中文63.02%/英文53.78%、Kimi-k2中文51.78%——中文值已经 Kimi 核验对照论文修正)、AttuneBench的场次数字、认知-情感鸿沟引用的三个benchmark,都只停留在scout一手转述层面,尚未逐篇核对arXiv原文的图表与精确数值。这些数字会随模型迭代和榜单更新过期,读的时候把它们当'2026-07写作时的快照',不是恒定事实。
已知的具体出入——FACET论文的'感知/认知/互动'三阶段结构,surveys.md和evals.md两份侦察报告转述的细节略有不一致(evals.md把它简化对应成了MSCEIT'感知/促进/理解/管理'四分支模型),这个出入本身没有影响本图的核心叙事(识别与理解脱钩),但如果被追问'FACET到底是几层框架',要留意这处还没查原文厘清。
两个更深的开放问题——① ToM 争论里'更强的agentic模型是否会突破think vector揭示的浅层捷径',据侦察报告目前没有答案,这不是本图能替Kent下结论的地方;② Robin对照卡里的'质疑'本质上是一个Robin自己也从没做过的实证问题——从没有人测过Robin的内部推理是不是也存在类似的'心智词汇捷径',这张图只能诚实地把问题摆出来,不能假装已经有答案。