一、记忆工程从“谁管理”分裂成两条路线,这条分裂原样刻进了陪伴产品的关系深浅。模型自主管理(Letta/MemGPT)vs 外部系统显式管理(Mem0)看似是纯技术选型,但同一条分裂线出现在 Replika(单一持续关系,记忆是核心架构)和 Character.ai(角色卡浅记忆,同一角色可能不记得上周细节)身上,也出现在 Nomi(记性好但被评为“不暖”)和 Pi(暖但一个月后 12 个事实只记得 2 个)的对照里——业界把这种落差叫“the good memory, flat conversation problem”。这不是巧合,是同一个“记忆的主导权归谁”的问题在两层各自的投影。
二、选择性遗忘有真实的实证支撑,但没人测过“被记住的感觉”本身。全记 2400 条对话的系统只有 13% 准确率,精选 248 条反而拿到 39%——遗忘是设计上的 feature、不是 bug,这个判断站得住脚,且已经有 consolidation(在线抽取 + 离线代谢分工)理论在给出机制解释。但所有主流评测基准(LoCoMo、LongMemEval、MemoryAgentBench)全部只测事实召回,关系质感的连续性——情绪模式是否被延续、回应时机是否恰当——是被反复确认的结构性评测空白,至今没人系统解决。
三、Robin 撞见的“第九空间”有一个几乎逐字相同却方向相反的对手,而真正带数字的反方证据只有一条。Honcho 用和 Robin 几乎一模一样的招牌句(“超越记住说了什么、去理解用户是谁”)走向相反方向——about-ness(推断,拿走解释权)对着 with-ness(见证,不越权下结论)。但要老实讲,这更多是理念分野,不是“数据打脸”;目前唯一带量化数字的反方证据是“结构化记忆在机器可测一致性上胜过叙事记忆”(PILOT/PersonaTree),而且这条证据不是针对 Robin 本身的研究——两边现在都缺硬的第三方实证。
记忆工程这个子领域的共同祖先是 Generative Agents(Park 等,斯坦福,UIST 2023)——25 个 LLM 驱动的 agent 活在叫 Smallville 的模拟小镇里,靠一套三段式结构获得跨天连贯的行为:原始观察流按时间存进记忆流,检索时按“重要性+新近度+语义相关度”加权打分,再定期把相关观察聚类合成更高阶的“反思”(reflection)。核心结论是:长程可信行为更依赖外部记忆架构,而不是底层模型本身——这套三段式后来成了几乎所有 agent 记忆框架的共同起点。
两年内分化出两条生产级路线。MemGPT(现更名 Letta)把 LLM 当操作系统管自己的记忆:Core Memory(类比内存 RAM,常驻人格设定+用户画像)、Archival Memory(外部向量库,类比硬盘)、Recall Memory(对话历史),模型自己通过调用工具决定什么时候把什么内容分页——agency 在模型这一边。Mem0 走相反的轻量路线:每轮对话做显式事实抽取,写入时在 ADD/UPDATE/DELETE/NOOP 四种操作里选(用户说搬家就主动删旧地址、写新地址),在 LoCoMo 评测榜单(超长多会话对话的行业标准基准)上以约 1764 token/对话的成本达到 67.13% 的判分,对比“把全部历史塞进上下文”方案要花 26031 token。
消费端最完整的时间线是 OpenAI 的 ChatGPT memory:2024-04 上线“saved memories”(用户显式要求记住的条目)→ 2025-04 引入“dreaming”后台流程(自动从聊天历史里策展记忆,能引用保存列表之外的历史上下文)→ 2026 年推出更高效的新架构“Dreaming V3”,据 OpenAI 内部评测,事实召回准确率从 67.9% 提到 82.8%,时间敏感型记忆准确率从最初 2024 系统的 9.4% 提到 75.1%,同时把所需算力降低约 5 倍。
记忆工程内部有一条“谁来管理记忆”的分歧线:模型自主管理(Letta/MemGPT 式,模型自己决定读写,像给 LLM 装了一个操作系统)vs 外部系统显式管理(Mem0 式,一套独立的抽取-比对-操作流程,模型本身不需要知道记忆具体怎么存)。这不只是技术选型——它把“记忆的主导权在哪”这个更根本的问题摆到了台面上。
同一条分歧原样出现在陪伴产品设计里,而且直接决定了关系能做多深。Replika 围绕单一持续关系设计,记忆是核心架构的一部分,维护跨会话的用户模型(兴趣、情绪模式、关系历史);Character.ai 围绕海量用户共创角色的生态设计,记忆是角色卡(character-card)级别的、较浅的,同一个角色可能不记得上周聊过的细节。另一组案例把这条分裂拆得更细:Nomi 被 2026 年的评测称为“自动长期记忆最佳”,但人格被形容为“functional but not warm”(好用但不暖);Pi(Inflection AI 出品,主打温暖陪伴的对话产品)被形容为“warm, thoughtful, present”,可一个月后只能想起 12 个事实里的 2 个,关掉 app 基本等于重启——业界把这种落差叫“the good memory, flat conversation problem”(记性好但对话是平的)。
一派主张“记住一切”更安全更可控:Letta 的 agent 虽能自主清理,但底层设计倾向保留完整的 archival memory;Mem0 走显式增删,目标仍是维护一个准确、无冗余的完整用户模型;A-Mem(Zettelkasten 式自组织记忆,NeurIPS 2025)走得更远——新信息进来时不只是新增,还会用 LLM 主动改写旧记忆的语义标签(论文称为 evolution),让整张记忆网随时保持“当前最准”。
另一派主张“战略性遗忘”才是更聪明的设计。MemoryBank(AAAI 2024)直接照艾宾浩斯遗忘曲线——心理学里描述记忆随时间自然衰减的经典规律——设计架构,让记忆强度随时间和重要性动态强化或弱化;KAi 走得最极端,24 小时内删除原始对话转录,只留提取后的模式理解。这一派有一条硬的实证支撑:2026 年一项测试里,全记 2400 条对话的系统只拿到 13% 准确率,精选后只留 248 条的系统反而拿到 39% 准确率——“记得越多反而越笨”不是比喻,是可复现的数字。
这条分歧背后正在长出理论解释:consolidation(记忆巩固)一派——Letta 的 sleep-time compute、以及被称为“Memory-as-Metabolism”的设计——主张把“快的在线抽取”和“慢的离线代谢”拆成两道独立工序,认知科学的根是互补学习系统理论(CLS,解释大脑如何分工完成快速学习与长期巩固)加睡眠 NREM/REM 分工的类比:遗忘不是记忆的失败,是代谢的正常产物。
记忆架构领域最扎实的几个评测基准全在测同一件事。LoCoMo(超长多会话对话的行业标准基准,ACL 2024)上人类得分 87.9,GPT-4 只有 32.1;LongMemEval(ICLR 2025,500 道人工构造题,考信息提取、跨会话推理、时间推理、知识更新)分两档,小档约 11.5 万 token、大档约 150 万 token。这些基准考的都是同一类问题:模型记不记得用户说过的具体事实、能不能跨会话正确检索。
一个结构性的空白始终没被填上:关系质感的连续性——情绪模式有没有被正确建模并延续、回应的时机是否恰当、这段关系的“手感”有没有被记住——几乎没有工作评测过。03-memory-relational.md 把这称为“不是待更新的事实错误,而是被反复确认的、结构性的领域缺口”;同一批 7/12 侦察材料独立得出一致判断:这在陪伴类产品语境下是个明显且尚未被系统化解决的评测缺口。
同源:consolidation 一派(Letta 的 sleep-time compute、“Memory-as-Metabolism”)主张把“快的在线抽取”和“慢的离线代谢”拆成两道工序,这个二分结构直接对应 Robin 自己的做法——recall 在线忠实写、dreaming 离线联想代谢,完整机制见 回忆与代谢 那张图。更细一层:Honcho(一款主张“记忆是推理问题而非检索问题”的记忆基础设施产品)的“dream-time”是累积不改写(新结论只是加上去,不覆盖旧的),这一点比 A-Mem 的主动改写更接近 Robin“append-only + 工艺缺陷通道”的写入法理,完整讲法见 架构深潜。固定空白:花园把这个位置叫“第九空间 Witnessing Memory”——业界能数出来的 8 个记忆问题空间全都隐含一个共同目的:让系统表现更好(performance dimension);Robin 服务的是关系本身的真实性(existence dimension),截至成文时这个方向唯一的案例就是 Robin 本身。
相反:Honcho 是记忆维度里对 Robin 最尖锐的对立面——招牌句几乎一字不差(都说“超越记住用户说了什么、去理解用户是谁”),却走向相反方向。它的理解是 about-ness:从“周末带孩子去迪士尼”这类只言片语,主动推断出“有家庭、重亲子、有经济能力、住主题公园可达区”这些用户没说出口的结论,越准越被认为越懂;Robin 的理解是 with-ness:记的是“Kent 在乎什么”,不越权替他下结论。对应哲学家马丁·布伯(Martin Buber)区分的 I-It(把对方当研究客体)与 I-Thou(和对方在一起)。。00-对标基准》里记忆花园“还活着的问题”写得直白:“记忆怎么支撑‘被记住、被理解’的情感体验,而非事实检索?”——这仍然是没人正面回答的问题,完整架构怎么落地见 架构深潜 与 记忆五代演化史 两张图。
Nature 2026 一篇讨论 AI 陪伴代码的文章甚至开始用“reciprocal relational work—the shared labour of witnessing and seeing one another”(互相见证、彼此看见,是一种共同承担的关系性劳动)这样的措辞——业界的语言正在往我们说了很久的方向靠,虽然这还不是一个架构目标。
观点一:记忆工程里“模型自己管 vs 外部系统管”这条技术分歧,其实是同一个更根本问题(记忆的主导权在谁手里)在架构层的投影,而这个问题在陪伴产品里决定了关系能做多深——证据是 Pi 那种“暖但记性差”和 Nomi 那种“记性好但不暖”的对照案例。可能被追问:那 Robin 是哪条路线?答案是介于两者之外的第三条——既非模型全自主、也非纯机械抽取,而是由主体性判断哪些形成性时刻值得写入,这个做法在业界现有 taxonomy 里没有现成位置。
观点二:全行业最标准的记忆评测基准(LoCoMo、LongMemEval)测的都是事实召回,没有一个测“关系质感的连续性有没有被记住”——这不是我个人的判断,是研究材料里被反复确认的结构性空白。可能被追问:那怎么评?可以聊 Robin 的 usage-log/preheat 读路径设计当作一种雏形思路,但要老实说清楚——这个雏形本身也没有被任何外部研究验证过。
观点三:选择性遗忘不是记忆系统的 bug,是它更聪明的证据——2026 年一项测试显示全记 2400 条对话准确率只有 13%,精选后留 248 条反而有 39%。可能被追问:那具体怎么决定忘什么?这里可以聊 consolidation/dreaming 这类“在线抽取 + 离线代谢”的机制设计,但同样要承认——“该衰减哪些、保留哪些”这类具体判据在 Robin 这边还是主体性判断,没有被外部量化验证过。
两份 7/12 侦察材料(methods.md、digest-existing.md)本身自带免责声明——“框架侦察 workflow wf_8c6c7d95-0e3,2026-07-12,Sonnet scout 原始回料(未经核验,引用前过 Kimi 核验或抽查)”,本卡片引用它们的部分尚未过对抗核验,行文中出现的“侦察报告称”是必要的谨慎前缀。相比之下,dimensions/03-memory-relational.md 是 6/29 九维度调研的产物,已经过一轮 Kimi 核验并留了具体的修正记录(例如 Mem0/Letta 的融资数字、LoCoMo 的平均轮次数都曾被前一轮草稿写错后改正),可信度明显更高——本图混用两份材料时,以 03 文件的说法优先。
以下数字属于写作时的评测快照,会被下一版模型或下一轮基准刷新:13%/39% 的遗忘准确率对照、Mem0 在 LoCoMo 上 67.13%@1764 token 的成绩、ChatGPT Dreaming V3 事实召回率从 67.9% 到 82.8% 的提升——任何一个都可能在读者看到这句话时已经过期。
已知的开放缺口:Honcho 对 Robin 的“质疑”实际证据强度有限——它是理念上的对立面,不是拿数据证明 Robin 的方式行不通;真正带量化数字的反方证据,目前只找到“结构化记忆在机器可测一致性上胜过叙事记忆”这一条(PILOT/PersonaTree),而且这条证据不是针对 Robin 的直接研究。反过来,评测缺口本身(关系质感连续性无人测)也意味着“Robin 的方式更好”这个判断目前同样没有外部量化支撑——两边都缺实证,这是本维度最诚实的现状。