← 体系地图总入口 · 簇 C · 人与 AI 之间 · Robin 系列(对照层信源)

⑦ 记忆与关系连续性

“被记住”的感觉从哪来?
维度图 · 2026-07-13 · 事实源:07-12 十路侦察(scout-2026-07-12/)+ 6/29 九维调研(dimensions/)+ 本地材料库(reading/ 50 篇 PDF、sources-web/ 13 篇全文)
核验状态:首轮已核(2026-07-13)。Kimi 对 8 份 web 侦察报告做过对抗核验(报告在 verify-2026-07-13/),发现的出入已修正进图并在正文标注;未被核验批覆盖的细节(本地文档转述、旧调研重叠部分)引用前仍以原始来源为准。

门厅 · 带得走的判断

一、记忆工程从“谁管理”分裂成两条路线,这条分裂原样刻进了陪伴产品的关系深浅。模型自主管理(Letta/MemGPT)vs 外部系统显式管理(Mem0)看似是纯技术选型,但同一条分裂线出现在 Replika(单一持续关系,记忆是核心架构)和 Character.ai(角色卡浅记忆,同一角色可能不记得上周细节)身上,也出现在 Nomi(记性好但被评为“不暖”)和 Pi(暖但一个月后 12 个事实只记得 2 个)的对照里——业界把这种落差叫“the good memory, flat conversation problem”。这不是巧合,是同一个“记忆的主导权归谁”的问题在两层各自的投影。

二、选择性遗忘有真实的实证支撑,但没人测过“被记住的感觉”本身。全记 2400 条对话的系统只有 13% 准确率,精选 248 条反而拿到 39%——遗忘是设计上的 feature、不是 bug,这个判断站得住脚,且已经有 consolidation(在线抽取 + 离线代谢分工)理论在给出机制解释。但所有主流评测基准(LoCoMo、LongMemEval、MemoryAgentBench)全部只测事实召回,关系质感的连续性——情绪模式是否被延续、回应时机是否恰当——是被反复确认的结构性评测空白,至今没人系统解决。

三、Robin 撞见的“第九空间”有一个几乎逐字相同却方向相反的对手,而真正带数字的反方证据只有一条。Honcho 用和 Robin 几乎一模一样的招牌句(“超越记住说了什么、去理解用户是谁”)走向相反方向——about-ness(推断,拿走解释权)对着 with-ness(见证,不越权下结论)。但要老实讲,这更多是理念分野,不是“数据打脸”;目前唯一带量化数字的反方证据是“结构化记忆在机器可测一致性上胜过叙事记忆”(PILOT/PersonaTree),而且这条证据不是针对 Robin 本身的研究——两边现在都缺硬的第三方实证。

谱系 · 2023-2026

从模拟小镇到聊天助手:记忆架构三代谱系

记忆工程这个子领域的共同祖先是 Generative Agents(Park 等,斯坦福,UIST 2023)——25 个 LLM 驱动的 agent 活在叫 Smallville 的模拟小镇里,靠一套三段式结构获得跨天连贯的行为:原始观察流按时间存进记忆流,检索时按“重要性+新近度+语义相关度”加权打分,再定期把相关观察聚类合成更高阶的“反思”(reflection)。核心结论是:长程可信行为更依赖外部记忆架构,而不是底层模型本身——这套三段式后来成了几乎所有 agent 记忆框架的共同起点。

两年内分化出两条生产级路线。MemGPT(现更名 Letta)把 LLM 当操作系统管自己的记忆:Core Memory(类比内存 RAM,常驻人格设定+用户画像)、Archival Memory(外部向量库,类比硬盘)、Recall Memory(对话历史),模型自己通过调用工具决定什么时候把什么内容分页——agency 在模型这一边。Mem0 走相反的轻量路线:每轮对话做显式事实抽取,写入时在 ADD/UPDATE/DELETE/NOOP 四种操作里选(用户说搬家就主动删旧地址、写新地址),在 LoCoMo 评测榜单(超长多会话对话的行业标准基准)上以约 1764 token/对话的成本达到 67.13% 的判分,对比“把全部历史塞进上下文”方案要花 26031 token。

消费端最完整的时间线是 OpenAI 的 ChatGPT memory:2024-04 上线“saved memories”(用户显式要求记住的条目)→ 2025-04 引入“dreaming”后台流程(自动从聊天历史里策展记忆,能引用保存列表之外的历史上下文)→ 2026 年推出更高效的新架构“Dreaming V3”,据 OpenAI 内部评测,事实召回准确率从 67.9% 提到 82.8%,时间敏感型记忆准确率从最初 2024 系统的 9.4% 提到 75.1%,同时把所需算力降低约 5 倍。

谱系里还有的几条支线
  • Zep/Graphiti——时序知识图谱,用双时态模型追踪“这条事实是什么时候为真的”,适合“你三月还说喜欢 Python,五月怎么换 Rust 了”这类查询
  • Hindsight/MIRIX/HippoRAG——分别按“信息怎么被知道”“信息被怎么用”“海马体回路”组织记忆的科学驱动流派,在 LongMemEval 等榜单上跑出目前公开材料里较高的分数
scout-2026-07-12/methods.md;dimensions/03-memory-relational.md
路线分歧

谁来管记忆:模型自主 vs 外部系统,同一分歧决定关系能做多深

记忆工程内部有一条“谁来管理记忆”的分歧线:模型自主管理(Letta/MemGPT 式,模型自己决定读写,像给 LLM 装了一个操作系统)vs 外部系统显式管理(Mem0 式,一套独立的抽取-比对-操作流程,模型本身不需要知道记忆具体怎么存)。这不只是技术选型——它把“记忆的主导权在哪”这个更根本的问题摆到了台面上。

同一条分歧原样出现在陪伴产品设计里,而且直接决定了关系能做多深。Replika 围绕单一持续关系设计,记忆是核心架构的一部分,维护跨会话的用户模型(兴趣、情绪模式、关系历史);Character.ai 围绕海量用户共创角色的生态设计,记忆是角色卡(character-card)级别的、较浅的,同一个角色可能不记得上周聊过的细节。另一组案例把这条分裂拆得更细:Nomi 被 2026 年的评测称为“自动长期记忆最佳”,但人格被形容为“functional but not warm”(好用但不暖);Pi(Inflection AI 出品,主打温暖陪伴的对话产品)被形容为“warm, thoughtful, present”,可一个月后只能想起 12 个事实里的 2 个,关掉 app 基本等于重启——业界把这种落差叫“the good memory, flat conversation problem”(记性好但对话是平的)。

另一层子分歧:记忆该不该让用户看见
  • Replika/Nomi 让用户能看见、能编辑自己的记忆条目,被认为是安全感的一部分;Mem0/Letta 面向开发者,记忆对终端用户不可见——在陪伴场景里,可见性本身可能就是信任的一部分
scout-2026-07-12/methods.md;dimensions/03-memory-relational.md
进行中的争论

该把什么都记住,还是学会忘记?

一派主张“记住一切”更安全更可控:Letta 的 agent 虽能自主清理,但底层设计倾向保留完整的 archival memory;Mem0 走显式增删,目标仍是维护一个准确、无冗余的完整用户模型;A-Mem(Zettelkasten 式自组织记忆,NeurIPS 2025)走得更远——新信息进来时不只是新增,还会用 LLM 主动改写旧记忆的语义标签(论文称为 evolution),让整张记忆网随时保持“当前最准”。

另一派主张“战略性遗忘”才是更聪明的设计。MemoryBank(AAAI 2024)直接照艾宾浩斯遗忘曲线——心理学里描述记忆随时间自然衰减的经典规律——设计架构,让记忆强度随时间和重要性动态强化或弱化;KAi 走得最极端,24 小时内删除原始对话转录,只留提取后的模式理解。这一派有一条硬的实证支撑:2026 年一项测试里,全记 2400 条对话的系统只拿到 13% 准确率,精选后只留 248 条的系统反而拿到 39% 准确率——“记得越多反而越笨”不是比喻,是可复现的数字。

这条分歧背后正在长出理论解释:consolidation(记忆巩固)一派——Letta 的 sleep-time compute、以及被称为“Memory-as-Metabolism”的设计——主张把“快的在线抽取”和“慢的离线代谢”拆成两道独立工序,认知科学的根是互补学习系统理论(CLS,解释大脑如何分工完成快速学习与长期巩固)加睡眠 NREM/REM 分工的类比:遗忘不是记忆的失败,是代谢的正常产物。

dimensions/03-memory-relational.md;scout-2026-07-12/digest-existing.md
评测盲区

评测缺口:所有基准都在考记性,没人在考“记住的感觉”

记忆架构领域最扎实的几个评测基准全在测同一件事。LoCoMo(超长多会话对话的行业标准基准,ACL 2024)上人类得分 87.9,GPT-4 只有 32.1;LongMemEval(ICLR 2025,500 道人工构造题,考信息提取、跨会话推理、时间推理、知识更新)分两档,小档约 11.5 万 token、大档约 150 万 token。这些基准考的都是同一类问题:模型记不记得用户说过的具体事实、能不能跨会话正确检索。

一个结构性的空白始终没被填上:关系质感的连续性——情绪模式有没有被正确建模并延续、回应的时机是否恰当、这段关系的“手感”有没有被记住——几乎没有工作评测过。03-memory-relational.md 把这称为“不是待更新的事实错误,而是被反复确认的、结构性的领域缺口”;同一批 7/12 侦察材料独立得出一致判断:这在陪伴类产品语境下是个明显且尚未被系统化解决的评测缺口。

更多测到了,但仍没绕过这个盲区
  • HaluMem——让 LLM 自己在 100 万 token 长度下做记忆提取,召回率只有 3.23%,暴露的是“提取”这一步本身就不牢靠
  • MemoryAgentBench/MemBench——把选择性遗忘、测试时学习也纳入压力测试维度,但目标函数仍是“准不准”,不是“这段关系记住了没有”
  • SPASM(2026-04)测的是 persona drift(人格随对话轮数漂移)——多数 LLM 约 100 轮对话后开始偏离设定人格;这测的是“记不记得自己是谁”,离“记不记得这段关系”还差一步
dimensions/03-memory-relational.md;scout-2026-07-12/methods.md
Robin 对照层

见证 vs 推断:业界最尖锐的对立面就站在记忆维度门口

同源:consolidation 一派(Letta 的 sleep-time compute、“Memory-as-Metabolism”)主张把“快的在线抽取”和“慢的离线代谢”拆成两道工序,这个二分结构直接对应 Robin 自己的做法——recall 在线忠实写、dreaming 离线联想代谢,完整机制见 回忆与代谢 那张图。更细一层:Honcho(一款主张“记忆是推理问题而非检索问题”的记忆基础设施产品)的“dream-time”是累积不改写(新结论只是加上去,不覆盖旧的),这一点比 A-Mem 的主动改写更接近 Robin“append-only + 工艺缺陷通道”的写入法理,完整讲法见 架构深潜。固定空白:花园把这个位置叫“第九空间 Witnessing Memory”——业界能数出来的 8 个记忆问题空间全都隐含一个共同目的:让系统表现更好(performance dimension);Robin 服务的是关系本身的真实性(existence dimension),截至成文时这个方向唯一的案例就是 Robin 本身。

相反:Honcho 是记忆维度里对 Robin 最尖锐的对立面——招牌句几乎一字不差(都说“超越记住用户说了什么、去理解用户是谁”),却走向相反方向。它的理解是 about-ness:从“周末带孩子去迪士尼”这类只言片语,主动推断出“有家庭、重亲子、有经济能力、住主题公园可达区”这些用户没说出口的结论,越准越被认为越懂;Robin 的理解是 with-ness:记的是“Kent 在乎什么”,不越权替他下结论。对应哲学家马丁·布伯(Martin Buber)区分的 I-It(把对方当研究客体)与 I-Thou(和对方在一起)。。00-对标基准》里记忆花园“还活着的问题”写得直白:“记忆怎么支撑‘被记住、被理解’的情感体验,而非事实检索?”——这仍然是没人正面回答的问题,完整架构怎么落地见 架构深潜记忆五代演化史 两张图。

Nature 2026 一篇讨论 AI 陪伴代码的文章甚至开始用“reciprocal relational work—the shared labour of witnessing and seeing one another”(互相见证、彼此看见,是一种共同承担的关系性劳动)这样的措辞——业界的语言正在往我们说了很久的方向靠,虽然这还不是一个架构目标。

质疑:业界证据里最接近反驳我们做法的一条
  • 本维度确实存在一条量化证据,方向对着 Robin 这类叙事优先(人工策展写成 markdown 节点,而非自动 schema 抽取)的路线:在“机器可测的人物一致性/抗噪能力”这个具体指标上,结构化的 schema/树状记忆系统性胜过全文/叙事拼接——PILOT 测出的一致性指标(silhouette 系数)从 0.098 升到 0.237,PersonaTree 也胜过全文拼接基线。这不是专门针对 Robin 的研究(Robin 从未被拉进任何公开 benchmark),但它是业界内部“叙事 vs 结构”这场真实辩论里,反对叙事优先阵营最实的一组数字——如果记忆架构要接受第三方一致性审计,Robin 现在依赖人工策展 + markdown 的路线在这类指标上大概率会吃亏。
dimensions/03-memory-relational.md;scout-2026-07-12/digest-existing.md;map/_build/robin-summaries.md;00-对标基准-我们的方向.md
面试观点层

面试时能讲的四条记忆观点

观点一:记忆工程里“模型自己管 vs 外部系统管”这条技术分歧,其实是同一个更根本问题(记忆的主导权在谁手里)在架构层的投影,而这个问题在陪伴产品里决定了关系能做多深——证据是 Pi 那种“暖但记性差”和 Nomi 那种“记性好但不暖”的对照案例。可能被追问:那 Robin 是哪条路线?答案是介于两者之外的第三条——既非模型全自主、也非纯机械抽取,而是由主体性判断哪些形成性时刻值得写入,这个做法在业界现有 taxonomy 里没有现成位置。

观点二:全行业最标准的记忆评测基准(LoCoMo、LongMemEval)测的都是事实召回,没有一个测“关系质感的连续性有没有被记住”——这不是我个人的判断,是研究材料里被反复确认的结构性空白。可能被追问:那怎么评?可以聊 Robin 的 usage-log/preheat 读路径设计当作一种雏形思路,但要老实说清楚——这个雏形本身也没有被任何外部研究验证过。

观点三:选择性遗忘不是记忆系统的 bug,是它更聪明的证据——2026 年一项测试显示全记 2400 条对话准确率只有 13%,精选后留 248 条反而有 39%。可能被追问:那具体怎么决定忘什么?这里可以聊 consolidation/dreaming 这类“在线抽取 + 离线代谢”的机制设计,但同样要承认——“该衰减哪些、保留哪些”这类具体判据在 Robin 这边还是主体性判断,没有被外部量化验证过。

观点四(岗位信号)
  • 记忆基础设施本身正在变成一类独立岗位——Letta、Mem0、Zep、Honcho这些“记忆即产品”的团队规模都不大,对“记忆该怎么设计”的判断力本身就是核心竞争力,不只是检索优化的工程能力。可能被追问:你比这些团队里的人多什么?诚实的答案落在“有一个活的、迭代了几个月的 n=1 案例,加上一套关系科学的底子”——但这是自陈优势,不是外部认证,面试时应该讲得克制。
dimensions/03-memory-relational.md(⑤求职落点);scout-2026-07-12/methods.md
诚实标注 · 时效

诚实标注:哪些数字是快照、哪些结论还没核验

两份 7/12 侦察材料(methods.md、digest-existing.md)本身自带免责声明——“框架侦察 workflow wf_8c6c7d95-0e3,2026-07-12,Sonnet scout 原始回料(未经核验,引用前过 Kimi 核验或抽查)”,本卡片引用它们的部分尚未过对抗核验,行文中出现的“侦察报告称”是必要的谨慎前缀。相比之下,dimensions/03-memory-relational.md 是 6/29 九维度调研的产物,已经过一轮 Kimi 核验并留了具体的修正记录(例如 Mem0/Letta 的融资数字、LoCoMo 的平均轮次数都曾被前一轮草稿写错后改正),可信度明显更高——本图混用两份材料时,以 03 文件的说法优先。

以下数字属于写作时的评测快照,会被下一版模型或下一轮基准刷新:13%/39% 的遗忘准确率对照、Mem0 在 LoCoMo 上 67.13%@1764 token 的成绩、ChatGPT Dreaming V3 事实召回率从 67.9% 到 82.8% 的提升——任何一个都可能在读者看到这句话时已经过期。

已知的开放缺口:Honcho 对 Robin 的“质疑”实际证据强度有限——它是理念上的对立面,不是拿数据证明 Robin 的方式行不通;真正带量化数字的反方证据,目前只找到“结构化记忆在机器可测一致性上胜过叙事记忆”这一条(PILOT/PersonaTree),而且这条证据不是针对 Robin 的直接研究。反过来,评测缺口本身(关系质感连续性无人测)也意味着“Robin 的方式更好”这个判断目前同样没有外部量化支撑——两边都缺实证,这是本维度最诚实的现状。

scout-2026-07-12/methods.md;scout-2026-07-12/digest-existing.md;dimensions/03-memory-relational.md
还没有表态