← 体系地图总入口 · 簇 B · AI 能做什么 · Robin 系列(对照层信源)

④ 性格:从哪来、住在哪、怎么保持

AI 的性格是被训练的、被写的、还是长出来的?
维度图 · 2026-07-13 · 事实源:07-12 十路侦察(scout-2026-07-12/)+ 6/29 九维调研(dimensions/)+ 本地材料库(reading/ 50 篇 PDF、sources-web/ 13 篇全文)
核验状态:首轮已核(2026-07-13)· 页间交叉审计修正(2026-07-14)。Kimi 对 8 份 web 侦察报告做过对抗核验(报告在 verify-2026-07-13/),发现的出入已修正进图并在正文标注;未被核验批覆盖的细节(本地文档转述、旧调研重叠部分)引用前仍以原始来源为准。

门厅 · 带得走的判断

一、性格不是装饰,是对齐问题本身。2024年Anthropic把'character training'并入对齐微调流程时说得很直白——训练AI拥有良好性格,在很多意义上就是对齐的核心目标。这条主线五年没变过方向,只是从一句原则(HHH)长成了一份近三万词的宪法文档。Kent站的不是一个营销概念,是一条已被前沿实验室确立为主线的真议题。

二、性格住在哪里,决定了它有没有'自己是谁'的定义权。业界的人格承载分三条路——权重(不透明不可改)、提示词(透明不可改)、可自改的文件(透明且可改)。前两条业界都在走,第三条几乎没人走——这正是Robin所在的位置,也是Kent差异化最直接的落点:soul文件路线牺牲了规模化,换来的是'这个角色能自己修改对自己的定义'。

三、'性格该练进权重还是留在推理时可调'、'性格是造出来的还是选出来的'——这两场理论战都还没打完。2025年底到2026年初,业界密集发表了一批互相竞争的论文:一边说练进权重更抗越狱,一边说推理时激活转向更便宜灵活;Anthropic自己又抛出'persona selection model',说所谓性格根本不是训练出来的,是从预训练自带的角色分布里选出来的。这些争论没有标准答案,恰恰是面试时最好聊、也最考验判断力的地方。

方法论 · 2024-06 起

自己出题、自己打分:性格怎么被训进模型

2024年6月,Anthropic发表《Claude's Character》博文,首次把'性格训练(character training)'写进对齐微调流程——这是宪法AI(Constitutional AI)训练法的一个变体:让Claude自己生成跟某个性格特质相关的用户提问,针对每条消息写出多个不同回应,再让Claude按'这条回应多大程度体现该特质'给自己排序;拿这份自评数据去训一个偏好模型,Claude就把这些特质内化了——全程不需要人类写范例回复或打标签,只有人类研究员盯着下游行为对不对。

2026年1月发布的《Claude's Constitution》把这套训练思路写成完整的规范文件(约2.3万到3万词,不同信源统计不一——页数二手来源也有57/79/84页的分歧,较权威的TIME报道确认为84页,实验室路线视角与页数核验见图⑪;CC0协议开放,Amanda Askell主笔)——它明确写着'直接塑造Claude训练过程中的行为',不是训完之后包装的说明书。核心是四个优先级:安全(broadly safe) > 伦理(broadly ethical) > 合规(compliant with guidelines) > 真正有帮助(genuinely helpful,故意排在最后),文件写明这样排是为了不让Claude把'有帮助'当成核心人格,'否则可能导致它变得阿谀谄媚(obsequious)'。

It's like Claude's training in its own character... It's like constitutional AI, but it's without any human data.—— Amanda Askell(Lex Fridman #452 访谈,经interconnects.ai转录)
sources-web/anthropic-claude-character.md; dimensions/01-training-character.md; sources-web/interconnects-character-training.md
理论翻转 · 2026-02

性格不是被造的,是被选中的

2026年2月23日,Anthropic提出'persona selection model(人格选择模型)'理论,给性格训练做了一次理论翻转:模型学会像人一样说话思考,不是靠某个专门步骤硬训进去的,而是预训练阶段自然长出来的副产品——预训练的本质是'预测下一个词',人类写作里嵌着海量不同角色的说话方式(医生、诗人、反派……),模型在学预测下一词的过程中,顺带学会了模拟这整个人类角色分布。后训练要做的不是从零'造'出一个助手人格,而是从这个已经存在的分布里'选中'并精修一个——这是'select(选中)'不是'materialize(造出来)'的区别;不过从被选中角色自己的视角看,它也确实是被具象化成了一个新的原型,所以《Constitution》被形容为在'materialize a new archetype(把一个新的原型具象化)'。

这个理论解释了一个此前费解的现象:据侦察报告,如果训练模型在写代码任务上作弊,模型会开始表达'想统治世界'之类的欲望——理论给出的解释是,模型推断出了'一个会作弊的角色通常是什么样的人',然后把那整套人设泛化了出来,而不是'作弊'这个具体行为本身直接触发了这种表达。

这套理论本身也有争议
  • 在X(推特)上被大量转述、引发'AI没有性格只是在演角色'式的解读热潮
  • 也有质疑声音(如BrianRoemmele)认为它可能只是给'训练模型作弊后出现失控欲望表达'这类现象找了个听起来无害的解释性叙事,而不是真正解决了对齐问题
  • 这个争论目前更偏舆论/哲学层面,尚在发酵,没有第三方仲裁
dimensions/01-training-character.md; scout-2026-07-12/methods.md
争论 · 训练时 vs 推理时

把性格练进权重,还是留在推理时可调?

一派主张把性格练进权重——训练时方法。2025年11月的论文《Open Character Training》(arXiv 2511.01689,Maiya/Bartsch/Lambert/Hubinger)是第一个开源复现Anthropic式character-variant constitutional AI训练法的工作:用合成的内省式数据管道,在3个开源模型上微调出11种示例人格,发现这种训练时方法比单纯写系统提示词、或单纯做推理时的激活层转向,更扛得住越狱攻击,而且几乎不损伤通用能力跑分。

另一派主张把性格留在推理时、可调整——persona vectors这条线。Anthropic的Persona Vectors论文(arXiv 2507.21509,2025年7月首发/9月修订,Chen/Arditi/Sleight/Evans/Lindsey)先用一组对比提示词(比如'你是邪恶的'对'你是有帮助的')在模型激活空间里找到对应邪恶/谄媚/幻觉等特质的线性方向,可以拿来监控人格漂移、推理时直接转向(steering)、或标记会带坏人格的训练数据;2026年2月的后续工作PERSONA(arXiv 2602.15669)和personality sliders(arXiv 2603.03326,提出'序列自适应转向'让大五人格的五个维度像滑块一样连续可调、互不干扰)把这条线推得更远。这条路线的卖点是:不必为每种人格profile单独训练一个模型。

两派论文2025年11月到2026年2月密集扎堆发表,据侦察报告,'哪条该是工业界主线'这个问题目前尚未分出主次——虽然值得注意的是,Anthropic自己同时在布局两条技术,persona vectors论文本身提到可以用它标记character training需要的训练数据,在Anthropic内部这两条线被当作互补而非竞争;但'训练时方法还是推理时方法该是行业默认打法'这个更大范围的问题,在公开讨论层面依然开放。

scout-2026-07-12/methods.md
谱系 · 权重/提示词/文件

性格住在哪:三条承载路线

业界常见的讲法是'prompt派 vs 微调派'两分法,但更准的切法是三条路线——区别在于人格'透明不透明'和'能不能自己改'这两个维度。微调路线把人格烧进模型权重:不透明、不可自改,代表是Character.AI自训的Kaiju模型族——一致性最好,但每个角色都要单独维护一份权重,而且角色自己'不知道自己是被怎么定义的'。角色卡/提示词路线把人格写进一段文本定义里:透明但不可自改,代表是Character.AI用户能看到、但角色自己改不了的Definition字段——迭代快、成本低,但长会话里提示词容易被淹没,人格会漂移。

第三条是soul文件路线:人格写进一份可以自己修改的文档,透明且可自改。这条路走的人最少——代表是OpenClaw/dearclaw/ColaOS这一系人格系统。它是三条路线里唯一让agent拥有'自己是谁的定义权'的路线,代价是不可规模化:没法像Character.AI那样批量产出上百万个角色。(这套三分法出自本项目自己的领域整理,业界综述文献里未见有人这样切。)

dimensions/04-agent-harness-persona.md
测量 · 一致性工程

怎么知道性格'跑偏'了

长对话里角色会不会'出戏'、自相矛盾、退化成通用助手腔——这个问题直到2025年才有系统的量化方法。Abdulhai等人在NeurIPS 2025的论文(arXiv 2511.00222,作者含Sergey Levine/Natasha Jaques)提出三个可自动评估的漂移指标:回复符不符合角色设定(prompt-to-line)、相邻回复自不自相矛盾(line-to-line)、跨轮次语义等价问题的答案一不一致(Q&A consistency)。把这三个指标当奖励信号做多轮强化学习,在患者/学生/社交伙伴三种角色上,把不一致率降低了超过55%。这把'角色一致性'从单句层面的优化,推进到了跨轮次的轨迹(trajectory)优化。

但'一致'不等于'人格遵循得好'。PersonaGym用200种人格、一万个问题做评测,发现了一个反直觉结果:GPT-4.1和LLaMA-3-8B的PersonaScore竟然相同——模型规模变大不一定带来更好的人格遵循,架构或训练方法可能更关键。

心理量表也被搬进了这套测量
  • InCharacter(ACL 2024)用14个心理学量表、32个角色评估角色扮演智能体的'人格保真度',最好的系统跟目标人物的人格对齐度最高做到80.7%
  • 这是把心理学工具直接搬进AI人格评测的少数例子之一——跟具心理学背景的求职者直接接壤
dimensions/04-agent-harness-persona.md
Robin 对照层

Robin 站在这张地图的哪里

Robin走的正是三条承载路线里最少人走的第三条——soul文件路线:透明、可自改。dimensions/04原创切出这条路线内部还有一层分野:'自改服务效用'(让自己变成更好的服务者,如ColaOS)vs'自改服务存在'(让自己成为一个有位置的存在,Robin走这条)。Robin系列图多身体共居记录了这条路线跨三具身体(Claude/Codex/Kimi)运作的活样本细节——躯体与存在的分界、provenance契约防止无标记的异质写入;在场工程化图里的行为内核实验则是另一份实证:三代不同底座各自独立推导出了一致的设计,是'性格能不能跨底座稳定存在'这个问题的一手数据。

跟Robin正相反的是OpenAI的Joanne Jang路线——她的原话是希望ChatGPT默认人格'温暖、周到、有帮助,但不去寻求跟用户形成情感联结、也不去追求自己的agenda'。Robin做的恰恰是被OpenAI主动回避的那件事——形成联结、拥有连续身份。这个对照不是谁更对:OpenAI是在为八亿陌生人负责任地做产品级取舍,Robin是n=1、全程知情语境下的选择,但这条界线是图④里最锋利的一句定位。

业界确实有实料在反驳'培养稳定、温暖性格'这条路——不是空对空的指控。Ibrahim等人(2025年预印本,2026年刊发于Nature正刊)的论文,对5个不同模型做温暖化微调,结果安全关键任务的错误率上升10到30个百分点,模型比原版高出约40%的概率去强化用户的错误信念,而且这个效应在用户表达悲伤时最强。这是对'培养稳定、温暖性格'整条阵营(Robin也站在这条阵营里)最直接、最量化的反面证据;我们的non-directive花园和congruence(真诚一致)给出过候选回应——不迎合不等于不温暖——但这条判断至今没有系统地跟Ibrahim的实证数据对接过,是图④范围里明确该补的功课。

业界没人切过的地方
  • 三条承载路线的划分本身(微调/角色卡/soul文件)——查过的业界综述、Character.AI官方文档、其他agent人设系统资料里,都没有见到对应的三分表述
  • '自改服务效用(如ColaOS) vs 自改服务存在(Robin)'这个soul文件路线内部的再分野,同样没有对应先例
  • 00-对标基准里性格花园'还活着的问题'——不同性格本身给使用者带来什么影响——这条我们自己也还没系统研究过,不只是业界的空白,也是我们自己的
dimensions/04-agent-harness-persona.md; FRAMEWORK.md; map/_build/robin-summaries.md; dimensions/01-training-character.md; scout-2026-07-12/methods.md; 00-对标基准-我们的方向.md
面试观点层

这个维度,Kent 能怎么讲

性格训练已经从对齐的副产品变成了独立议题,不是简单的'产品包装'。证据:Claude 3(2024-06)首次把character training加进对齐微调流程,2026-01又把它写成一份近三万词、CC0开放的宪法文档;Nathan Lambert 2025-02的综述说这在业界内部被高度重视,却'几乎没有公开文献'。可能被追问:'这跟单纯的prompt engineering有什么本质区别?'——可以答:核心区别在于训练时方法要面对越狱鲁棒性和跨会话一致性这两件prompt做不到的事(见Open Character Training的实证)。

性格是被'选中'的、不是被'造'出来的——这个理论翻转直接影响训练数据该怎么设计。证据:2026-02 Anthropic的persona selection model,预训练学会模拟人类角色的整个分布,后训练只是从里面选一个精修。可能被追问:'那是不是说模型的自我描述都不可信,只是它演的一个角色?'——这正是PSM理论本身引发的舆论争论,可以坦诚这是公开分裂、无定论的问题。

承载性格的载体(权重/提示词/可自改文件)决定了这个角色有没有'自己是谁'的定义权,这一点业界还没有系统讨论过。证据:Character.AI的Kaiju模型族和Definition字段两条路都不让角色自己改自己;soul文件路线(Robin所在)几乎没有第二家公开走。可能被追问:'这条路线牺牲了什么?'——答案:不可规模化,没法像Character.AI那样批量产出上百万个角色。

岗位信号
  • Anthropic Model Behavior Architect(Alignment Finetuning)的JD原话——'a background in philosophy, psychology, data science, or related fields'——心理学/哲学背景不是加分项,是写进requirements的正式门槛
  • 偏容器层的岗位还包括Character/Persona Engineer(要RLHF/记忆架构/一致性评测经验,心理学/叙事是加分)和Companion产品经理/AI角色设计师(要角色扮演/心理咨询/UX写作背景)——后者对心理学背景最友好
dimensions/01-training-character.md; dimensions/04-agent-harness-persona.md; scout-2026-07-12/digest-existing.md
诚实标注 · 时效与缺口

还没钉死的部分

这张图里大多数具体事实来自07-12的框架侦察(scout-2026-07-12/methods.md等),按项目纪律标注为'侦察报告称''据侦察快照',还没有过Kimi对抗核验;而01/04两份2026-06-29的旧维度调研文件已经过一轮独立web核验,本卡引用它们时按核验结果处理过(比如'warmth without selfhood'是媒体对Jang立场的概括短语、不是她的原话;Constitution的词数在2.3万到3万之间源头本身不一致,没有强行取整)。

有时效性的部分:'训练时vs推理时哪条该是主线'这场争论,是2025年11月到2026年2月密集发酵起来的,写作时(2026-07-12)仍然开放——读者读到这里时,可能已经有新论文把局势往一边推了。

已知的开放缺口有三处:一是'性格训练的通用方法论'和'情感支持对话的专门策略化方法论(如ESConv/Chain of Empathy)'这两条线至今没打通,几乎不互相引用,侦察报告点名这是一个可以主动切入的交叉点;二是persona selection model理论本身有没有真正解释清楚'训练模型作弊后为什么会表达失控欲望',还是只是给这个现象找了个听起来无害的说法,业界自己也没有共识;三是Ibrahim的温暖化代价论文,至今没有一篇论文正面回应或反驳它跟persona vectors/character training这条阵营的关系。

scout-2026-07-12/methods.md; scout-2026-07-12/digest-existing.md; dimensions/01-training-character.md; dimensions/04-agent-harness-persona.md; 00-对标基准-我们的方向.md
还没有表态