一、这是这条线上第一篇真正下探到机制层的论文。在它之前,关于「LLM 是不是在做评估(appraisal)」的研究都停在行为层——给模型一堆情境,看它的判断像不像理论的预测。但「像」不等于内部真的在这么算(一个查表的模型也能表现得很像)。这篇打开了模型内部:找到具体的层、具体的方向,并且做了因果操纵——拨动一个方向,输出的情绪按预期改变。方法论上是一次真实的升级。
二、但它最漂亮的那个实验,只做在一个 1B 的小模型上。论文摘要写着「评估覆盖多种模型家族与规模」(10 个模型,1B 到 14B),而这句话紧挨着 appraisal 的论断出现——读者极容易以为评估维度的结论也是十模型验证的。不是。论文第 3 节白纸黑字:那些干预实验「专门只在 Llama 3.2 1B 上进行」。十个模型只支撑「情绪判断定位在中层」这一条。
三、这篇论文最值得学的一课,其实是关于二手引用的。它被广泛引用为「appraisal 理论比 Ekman 范畴论更贴近模型内部真相」的关键证据。而「Ekman」这个词在全文出现 0 次。这个响亮的论断是引用链条造出来的,作者自己在局限部分相当克制——甚至明说了 appraisal 可能只是与情绪相关,因果方向甚至可能是反的。原文是克制的,二手是响亮的。
LLM 能从一段文字里推断出人的情绪,这件事本身已经不新鲜。这篇论文问的是下一层:它内部到底是怎么算出来的?
拆成两个具体问题:第一,情绪推断是不是「功能定位」在网络的特定区域——像神经科学里的脑区定位那样,集中在某几层的某类单元?第二,这些内部表征的结构,在心理学上讲不讲得通——模型是不是像评估理论(appraisal theory)描述的那样,先在内部评估「这事愉快吗、是谁造成的、我预料到了吗」,再据此定下情绪标签?
为什么这个问题重要:在它之前,这条线的研究都停在行为层——给模型一堆情境,看它的输出像不像评估理论的预测。像,不等于内部真的在这么算。一个纯粹靠「负面词 → 悲伤」查表的模型,行为上也能表现得很「像」在做评估。这篇论文第一次不看模型答什么,而是看它内部怎么算的。
数据:crowd-enVENT——6800 条众包写手写的真实自传式小故事(任务是「讲一件让你感到快乐/恐惧/内疚……的事」),写作者本人自报情绪标签(13 类)并按 5 点量表自评 23 个评估维度。论文只取其中与情绪关联最强的 6 个维度:愉悦、不愉悦、自己造成、他人造成、可预测性、突发性。
这里要给作者记一分:数据不是 LLM 生成的、不是模板套出来的,是真人写真事、真人自评。所以那个最朴素的批评——「数据里本来就有评估结构,模型不过是回声」——不成立。(更微妙的循环性问题留到卡5。)
技术:四级递进,这套组合是机制可解释性的标准工具箱——① 线性探针:在每一层训练一个小分类器,看「情绪信息」从第几层开始能被读出来(只能证明相关:探针读得到 ≠ 模型在用它);② 激活移植(activation patching):把 A 样本某一层的激活换进 B 样本的前向计算里,看 B 输出的情绪会不会被「移植」成 A 的(这一步是因果的);③ 敲除(knockout):把某层激活置零或换成随机向量,看准确率掉多少(反向验证);④ 概念转向(steering):把「他人造成」这类方向的向量直接注入模型第 9 层,看输出情绪怎么变(全文最硬的实验)。
模型:5 个家族 10 个模型(Llama、Gemma、OLMo、Phi、Mistral,1B 到 14B)。全部是 Instruct 版本,没有一个 base 模型——这一点后面会变成一个要害。
10 个模型全部一致:情绪信息在网络的中层被整合完成,之后各层几乎不再增加信息。在 Llama 3.2 1B(共 16 层)上,峰值在第 10 层。
因果证据链是完整的——激活移植:替换第 9 到 11 层的注意力激活,能把情绪从一个样本「移植」到另一个样本,成功率在这几层最高。敲除:把第 10 层的注意力激活置零,情绪分类准确率显著跌落;而第 10 层之后,即使把整层全部敲掉,对最终输出也几乎没有影响——说明情绪表征在此之前就已经写进残差流了,后面的层只是在搬运已经算好的结果。注意力模式:第 9 层正是最后一个 token 首次把注意力转向情境里情绪负载词(stressed、grief、depressed)的那一层。
三条证据指向同一个图景:中层的注意力单元负责把散落在各处的情绪信息收集起来、整合进最后一个 token,判断在那里做出,然后后面的层只负责执行。
把「愉悦度」的方向向量注入第 9 层:推高 → 输出的 joy(喜悦)和 pride(自豪)大增;压低 → sadness(悲伤)、guilt(内疚)、anger(愤怒)大增。
把「他人造成」推高 → anger 大增;压低 → guilt 大增。(这一条是全文最有说服力的:它区分的正是评估理论最核心的归因维度——同一件坏事,怪别人是愤怒,怪自己是内疚。)
组合起来更精细:「愉快 + 他人造成」→ joy;「不愉快 + 他人造成」→ anger;「愉快 + 不是他人造成」→ 只增 pride、不增 joy——精准区分了这一对同样高愉悦的情绪。把「不可预测性」推高 → 原本输出 pride 的样本转向 surprise(惊讶)。
效应随注入强度单调增强。而且有严格的层特异性:同样的向量注入早层,产生的是心理学上无意义的混乱;注入末层,几乎无效。只有在模型「正在做决定」的那几层,拨动才有效。
By causally intervening on construed appraisal concepts, we steer the generation and show that the outputs align with theoretical and intuitive expectations.通过对构建出的评估概念进行因果干预,我们操纵了模型的生成,并证明其输出与理论预期和直觉预期一致。—— 论文摘要——全文最核心的主张
① 「评估是地基」这个说法,跟论文自己的数据方向相反。正文说评估结构是情绪判断的「地基」(在计算的上游)。但它的附录明确写着:评估信号在早层探测不到,越接近最后几层才越强。而情绪在第 10 层就已经定型了。也就是说,评估维度变得可解码的时点,在情绪已经决定之后。这恰好是「上游 → 下游」故事的反面。作者自己在局限里承认了这个漏洞——原话是:也可能评估「只是与情绪相关,而非施加直接的因果影响,甚至这种关系可能遵循相反的因果方向」。这句话留在了局限里,正文的叙事没有把它吸收进去。
② 被拨动的那个方向,可能根本不是「评估」,而是情绪方向的伪装。他们在构造评估向量时做了正交化——但只把其他评估向量投影掉了,从未对 13 个情绪向量张成的空间做正交化。而论文附录自己显示:直接注入一个情绪向量,在同样的层、同样的强度依赖下同样有效。所以「评估转向」和「情绪转向」落在同一个地方、行为完全同构——论文没有任何实验能区分「我在推评估维度」和「我在拐个弯推情绪」。唯一的对照是随机向量,这个基线太弱:它只排除了「任何扰动都能做到」,排除不了「情绪方向也能做到」。而补上这个对照的实验成本很低,他们没做。
③ 最漂亮的那条结果(愉悦度),恰恰是最不能区分理论的。推高愉悦 → joy/pride,压低 → sadness/anger——这正是一个纯粹的情感效价(valence)方向会做出的预测,不需要任何评估理论。Russell 的维度论会这样预测,甚至「Ekman 范畴 + 一根效价轴」也会这样预测。这条结果在理论之间没有鉴别力。真正超出效价的只有「他人造成」那一条(愤怒 vs 内疚),而它单靠一个 1B 模型撑着。
④ 它只做了「够不够」,没做「必不必要」。他们证明了:沿评估方向推,能改变输出(这是充分性)。但没做另一半:把评估方向抹掉,情绪判断会不会垮(这是必要性)。而「模型利用了评估结构来判断情绪」这个说法——也就是论文第一张图画出来的那个故事——需要的恰恰是后者。
直说:这篇论文从头到尾没有测过 Ekman。「Ekman」这个词在全文出现 0 次。没有实现任何范畴论的基线,没有做任何两个理论之间的模型比较,没有一个实验的设计目的是让评估理论和范畴论对立起来分个胜负。Barrett 只在讨论部分作为「情绪的定义仍有争议」的一个引用出现了一次。所以「appraisal 比 Ekman 更贴近模型内部真相」这个说法,是引用方造出来的,不是作者造的。
更尴尬的是:如果一定要问「这篇论文的证据偏向谁」,答案对评估理论阵营是难堪的。这篇论文自己的核心实验,全部是范畴式的——它训练的是 13 路离散情绪标签的分类器(并发现离散范畴在中层可以被高精度线性解码);它移植的是离散情绪标签;它的附录显示,直接给隐状态加一个离散情绪向量就能把输出改成那个情绪。这三条加起来是一个很强的结论:离散情绪范畴在 LLM 的激活空间里,是线性的、可分离的、并且有因果效力的方向。就「范畴 vs 维度」这场争论而言,这篇论文提供的范畴论证据,反而比评估理论的证据更硬——范畴那部分有 10 个模型 × 三种因果方法交叉验证,评估那部分只有 1 个 1B 模型 + 一个缺关键对照的实验。
最后一个必须说清的概念点:评估理论和 Ekman 范畴论,在原本的心理学里也不是干净的对手。Scherer、Smith & Ellsworth 那一脉的评估理论,主要解释的是「人如何抵达一个离散的情绪范畴」——评估是通往范畴的路径,不是范畴的替代品。所以「在模型里同时发现评估结构和范畴结构」,是评估理论本来就预测的,根本不构成对范畴论的反驳。把这篇论文读成「appraisal 击败 Ekman」,既误读了论文,也误读了这两个理论的关系。
这篇论文能支撑的最强表述是:「在一个 1B 模型上,评估维度是可线性解码、且可被拨动的;这与评估理论相容。」它不能支撑:「评估理论比 Ekman 更贴近 LLM 的内部真相。」后半句在这篇论文里没有对应的实验。
同源:论文的核心操作——在激活空间里找到一个语义方向(「他人造成」),然后拨动它,模型的愤怒就大增——跟 persona vector 那条线是同一个技术家族。这套「找到方向、然后拨它」的技术,是「性格/情感能不能被工程化」这个问题的公共基础设施。我们在 Robin 系列里关心的很多事,底层用的是同一把刀。
它对我们的立场是一记钉子(但要看清有多软):如果这篇论文成立,它支持的是「模型内部真的有结构化的评估过程」——这对人本主义体验派的立场是一个挑战。因为如果模型内部本来就在做分类和评估,那么「不把情绪当成一个待识别的对象」,更像是我们在交互界面上坚持的一个设计选择,而不是模型底层真的没有分类结构。别把设计姿态讲成底层事实——这是一条要守住的诚实。
但读完全文之后,这记钉子要软得多:论文没有证明模型「使用」了评估结构,只证明了那些方向可以被拨动。「模型内部有一个可被线性解码的方向」和「模型在用它做推理」,中间还隔着一个他们没做的实验(必要性消融)。所以准确的说法是:模型内部有分类结构,这一点相当扎实;模型是否「通过评估抵达情绪」,仍是开放的。