对齐协议列传 · 第一篇:grounding 一脉 × 机器侧证据对读
复制一段文字,粘贴给你的 AI 即完成
对齐协议列传 · 第一篇:grounding 一脉 × 机器侧证据对读
2026-07-14 首次 research session 产出。核验对象:INDEX 里自标「假设·未核验」的"实时表示对齐协议三条件"(2026-07-14 对话中用乐高比喻现场构造,
docs/讨论地图-智能压缩与信道补偿-2026-07-14.html卡3)。 材料:三路调研——① Clark(赫伯特·克拉克)grounding 一脉一手文献(读到原文 PDF);② Danielle Perszyk(丹妮尔·佩尔希克)一手核查;③ 机器侧 multi-agent 对齐文献(arXiv ID 已由主 agent 抽验为真)。
一、人类侧:三条件假设的核验结果——站得住,带两处修正
"实时表示对齐协议三条件"原表述:①理解拆成可指认小块 ②对方能对具体小块反应 ③反应改写下一轮生成,且发生在"活儿做完"之前;有通道≠有协议。
对照 Clark 一脉逐条核验:
① 可指认小块 —— 支持。 Clark & Wilkes-Gibbs 1986《Referring as a collaborative process》(指称作为协作过程)的实验里,说话人自发把描述切成可单独确认的小单元(installment / trial noun phrase——"分期表达"和"试探性表达",先确认一小块再继续)。Clark & Brennan 1991《Grounding in communication》专辟一节论证信息按"记忆广度可承受的小块"分批呈现。
② 对具体小块反应 —— 强支持,且有最硬的因果实验。 Schober & Clark 1989 的旁听者(overhearer)实验:第三方全程听到对话的每一个字,只是不能参与协商,最终任务表现显著差于真正的对话参与者。信息量完全相同,只差"能否反应"这一项——"有通道≠有协议"这句话在人类文献里有直接的实验形态:旁听者有完整的通道,没有协议参与权。
③ 反应在做完前改写生成 —— 部分支持,附加一个边界条件。 CWG1986 的 refashioning 机制(对方反应显示不理解时,说话人在该指称被接受前当场改写)正是这一条;经典数据:"溜冰者"tangram 图形六轮从平均 41 词收敛到 "The ice skater."(3 个词),无需修改直接被接受的最简交换占比从 18% 升到 88%。但 Brennan & Clark 1996 的 conceptual pacts(概念契约)给出边界:一旦双方就某物锁定了共同措辞,改写机制饱和——双方倾向沿用已确认的说法而非持续重新协商。条件③在契约建立前成立,建立后转为路径依赖。
诚实标注:没有任何一篇文献原样列出这三条——这是我们的框架映射到 Clark 一脉的机制证据上,映射本身是这次 session 做的,不是文献自带的清单。
二、机器侧:协议 vs 多样性——证据明显偏向多样性
关键论文(arXiv ID 逐一抽验为真,均预印本除注明外):
- More Agents Is All You Need(2402.05120,2024):同一模型独立采样多份再投票,无任何交互,性能就随样本数扩展,常超过复杂协作框架。
- The Cost of Consensus(2605.00914,2026):同质、无引导的 debate 里,独立自我修正反而更好——交互协议在此设定下是负收益。
- The Consistency Illusion(2606.08457,2026):debate 收敛出的"一致答案"底下推理链互相矛盾——协议达成的是表面共识(consistency),不是共享理解(agreement)。
- X-MAS(2505.16997,2025):异质模型配置系统性优于同质——极端情况 2 个异质 agent 追平 16 个同质 agent。
- Stop Overvaluing Multi-Agent Debate(2502.08788,2025):现有 debate 评测几乎全用同质配置,把采样效应和协议效应混在一起,系统性低估了异质设定下协议的价值。
- 涌现通信一脉(Lazaridou 等,1804.03984 / 2006.02419 / 2004.09124):给通道+任务压力,协议确实自发长出来,但"不组合、不可解释、不稳定"三病并发。
- Language drift / Agent drift(1909.04499 EMNLP 2019 / 2601.04170,2026):即使从自然语言出发,持续交互也会侵蚀协议(drift 成私有码);LLM multi-agent 里行为质量随交互轮次近似线性退化,约 300 轮后加速。
三、综合判断(本篇的立场)
协议的价值以异质性为前提;协议的真实工作是防销蚀,不是产信息。
人类侧和机器侧表面矛盾(旁听者实验说协议参与权有独立因果效力;同质 debate 实验说协议无用),实际拼成一个更好的框架:
- 人类对话者天生异质——每人背着不同的血肉经验,所以 grounding 协议总有真正不同的表征可对齐。协议在人类文献里效力显著,是因为异质性前提在人类身上默认成立。
- 同质 LLM 实例之间没有真正不同的视角——协议空转,增益全来自采样方差。这解释了 More Agents 一类反直觉结果。
- 交互本身销蚀多样性(drift、echo chamber、趋同)——所以协议的正经角色是保住多样性来源、让异质信息可汇总(防销蚀的通道),而非协议自己产生信息。
- 接判据环:协议不产生循环外新信息——异质先验才是新信息入口。这把开放问题 #1"对齐协议 vs 先验多样哪个是主引擎"从二选一重构为分工:多样性供给信息,协议防止信息在汇总中被销毁。
- 人机混合系统里的同一母题:Perszyk 在播客里给的案例——科学家个体用 AI 后产出变多、但整个学科思想多样性收窄——正是"交互销蚀多样性"在人类-AI 混合系统里的形态。她的行业批评(优化"任务完成"目标易被 reward hack,应改为"与用户心智模型对齐")与此同根。
旁证回收:7/9 富媒体调研里"抓住盲区的是换底座的批评者"这个一直悬着的信号,现在有文献解释了——换底座=引入异质先验。
四、Perszyk 核查结果(事实层)
- 核心命题转述准确:"智能不存在于个体人类中,它从我们的互动中涌现"(Latent Space 播客原话:"There's this category error. It doesn't exist in individual humans. It emerges from our interactions.")。
- 机构修正:Northwestern 认知科学博士(导师 Sandra Waxman,语言-认知接口方向,代表作 Annual Review of Psychology 2018 综述)→ Google(2018-2023)→ 现在 Amazon AGI Lab 带人机交互团队。不是 Google DeepMind——园里旧记录如有此说法以此为准。
- 她的主张出处是播客(David Eagleman 的 Inner Cosmos 第139集、Latent Space),不是同行评议论文——引用时注意置信度定级。
五、有裁判的世界 vs 没裁判的世界——判据环的一次精确化(2026-07-15)
触发:一篇论文(Ren Zhuang 单作者,arXiv 2507.21166,The Ratchet Effect in Silico,v3 2026-06-22,仅预印本、零第三方引用)表面上要打死本园的判据环。它叫 POLIS:让 4-5 个不同厂商的小模型(BitCPM4-1b / Qwen3 / Phi-4-mini / Gemma3 / Llama3.2,1-4B,跨家族跨架构——是真异质不是同模型多次采样)组成一个"微型社会",反复跑三步——出题(按种群当前通过率自适应生成新数学题)→ 筛选(每个 agent 独立作答,除作者外全体同伴一致投票核验,再按 TrueSkill 排序选"更清晰可传播"的解)→ 保留(最优解进共享缓冲区,每攒 1024 条就用 LoRA 微调内化进全体参数)。约 18 轮后,四个数学基准平均涨 8.8-18.9 分,最狠的一例是 BitCPM4-1b 在 MATH500 上 34.0 → 70.1。消融显示掉分最多的是那个"同伴一致投票核验"(54.8→37.8)。
为什么它威胁判据环:论文全篇没有交代那个核验环节有没有跟外部标准答案核对过——只含糊了一句"数学题有清晰的 ground truth,所以去中心化验证才可能"。如果核验纯粹是模型互相打分、从未接触客观答案,那就是"一群模型关起门来自己聊天,智能就涨了"——循环外没有新信息进来却提升了,判据环当场破产。
裁决:判据没被推翻,是它的措辞太窄了。
先看一个已经被反复验证过的同构案例:AlphaZero 自我对弈、不看任何人类棋谱,棋力却超越人类。这算"纯内循环产生智能"吗?不算——围棋规则是一个循环外的裁判。每一局的胜负由规则裁决,不由模型的意见裁决。规则不提供任何新数据,但它每局提供一个不可被循环内意见改写的"你赢了/你输了"。
数学是同一种裁判。POLIS 的循环里有世界在场,那个世界是逻辑本身——解的每一步能被检查,"对不对"不依赖谁的品味。所以这里的"同伴核验"实质上核验的是逻辑一致性(近乎客观),而不是"我觉得这个好"(纯主观共识)。
涨分的机制(我的判断,可证伪):数学有一个不对称性——验证一个解比生成一个解容易。一个 1B 模型往往生成不出正确解,但把正确解摆在它面前,它更可能认出来。POLIS 做的事是:让模型说十次、把大家都点头的那次挑出来、再 LoRA 练回去。它没有学到分布外的新知识,它把已经存在于分布里的、低概率的正确性放大了。 打个比方:一个人心里其实知道答案,但每次张口说对的概率只有三成;让他多说几遍、挑出大家都认可的那次、再练一练,他的输出概率就到七成——他没学到新东西,他只是变得更可靠。
所以 POLIS 印证而不是推翻本条目 §三的判断(协议只组织已有信息、不创造信息)——它把分散在异质种群各自参数里的、微弱的正确性汇聚出来。论文自己也承认了半边:"Its effectiveness depends on preserving independence; homogeneous populations and low-precision aggregation can amplify correlated errors (Hong & Page, 2004; Lorenz et al., 2011)."——它引的 Lorenz 2011 正是本园用来支持"交互销蚀多样性"的同一篇。
判据环的精确化(全园的秤改了措辞,这是本条目最重的产出)
旧措辞:循环外的新信息有没有变多、变快、变准地进来。(隐含假设:循环外的输入 = 新数据。)
新措辞:循环外的输入有两种形态—— - 新数据(望远镜带回的光子、别人血肉里的经验):给你新内容。 - 验证信号(世界对"你说得对不对"的裁决):不给你新内容,只给你一个比特(yes/no),但那个比特来自世界、不来自循环内任何一方的意见。
有裁判的领域(数学、代码、棋、任何 verifier 便宜的任务),第二种形态可以撑起自举——这正是当下"可验证奖励的强化学习"(RLVR)整条路线的地基,也是 AlphaZero 的秘密。没有裁判的领域,第二种形态不存在,协议就退回到只能防销蚀。
精确化之后判据环更强了,因为它现在能解释一件旧措辞解释不了的事:为什么同一套多智能体架构,在数学上能涨、在开放任务上多半会退化成回音室。
可证伪预言(这条精确化自己的把柄)
把 POLIS 那套架构原样搬到没有客观裁判的任务上(如"写一段有洞察的评论""设计一个方案"),增益应该显著缩水甚至变负——因为那时"同伴一致投票"退化成"我觉得好",趋同会吃掉多样性(Lorenz 2011 的机制接管)。如果有人做出来增益照样很大,这条精确化就错了,那时要认真考虑"纯主观共识也能产生新信息"这个更激进的可能。
论文本身的证据强度(不采信其数字)
- 单作者(杭州师范大学在读学生,邮箱含学号)、无同行评审、无 venue、v3 后仍只挂 arXiv、WebSearch 查不到任何第三方引用或复现——零外部验证的孤证。
- 无误差棒、无多随机种子、无显著性检验、无代码开源。
- 污染风险未排除:自动生成的训练题与 MATH500/GSM8K(预训练语料重灾区)的分布重叠没做核查。1B 模型靠内部生成数据微调就在 MATH500 上近乎翻倍,这个量级本身就该先怀疑污染。
- 异质 vs 同质那组关键对照变量没解耦:异质组 4 个模型、两个同质组各 3 个,"异质性效应"和"种群规模效应"混在一起(这一点值得记住——它本可以成为 loop Q2b 那个悬案的证据,但因为设计缺陷用不了)。
- 它对"棘轮"的用法本身有扩义:Introduction 里用的是我们校正过的窄定义("防止倒退",引 Dean 2012 / Tennie 2009),但 Related Work 里把累积文化演化框成达尔文式的"变异-选择-遗传"循环,系统里掉分最多的恰恰是主动择优的机制(Epistemic Filter + Quality Preference)——它一边引窄定义背书,一边用宽定义干活。这正是本园刚刚纠正过的那类方向性滑移的活案例。
留给后续的三个可查项:① 作者是否公开 Verify_k 的实现/prompt(当前无代码仓库);② 训练题与评测集的分布重叠;③ 一组严格的"4 异质 vs 4 同质"对照。这三点不清之前,POLIS 的数字不进本园任何判断的证据链——进本园的只有它逼出的那个精确化,而精确化的根据是 AlphaZero/RLVR 那条独立的、已被大规模验证的证据线,不是这篇论文。
六、集体智能因子 c 的实证战况(2026-07-18)——不是基石,是条件性构念
主轴三如果要一个"团队智能可测量"的实证地基,最经典的候选是 Woolley 等 2010 年 Science 提出的 集体智能因子 c(collective intelligence factor):团队像个体有 IQ 一样,存在一个跨任务的通用因子。原始数据:192 组/699 人,第一因子解释 43–44% 方差,对效标任务 r=.52 / β=.36,而平均/最高个体 IQ 不显著;三个明星预测因子——社会敏感度(读心测验 RMET,r=.26)、发言轮换均匀度(说话方差 r=–.41)、女性比例(r=.23,经社会敏感度中介)。
十五年复制战况——三个子命题分开裁:
- 「c 因子存在且可测」=削弱(不倒)。 强形式(任何任务任何群体可测的通用团队 IQ)倒了;条件形式站住:Graf-Drasch 2022(21 研究/907 组)给出边界条件——任务 >50% 结构良好(well-structured)时单因子出现,结构不良时消失(结构良好任务间平均相关 .24,结构不良仅 .11)。Riedl 2021(PNAS,22 研究/1356 组)AVE 44%、留一法预测 r=.40,但全部来自 MIT 自有 POGS 平台、多为 Woolley 团队数据。独立元分析 Rowe 2021(8 独立样本/857 组)c 与效标汇总相关 r=.26(CI .10–.40,对比原始 .52 是腰斩),且约 80% 研究统计效力不足以侦测自己声称的效应。Credé & Howardson 2017 的方法学指控(低努力作答 + 嵌套数据两个统计假象虚增共变,"insufficient support")未被完全洗清,也未被坐实为全部解释。c 现在的准确身份是条件性构念,不是测量公理。
- 「社会敏感度是预测因子」=削弱。 三者中最可能真实:原始 r=.26、Engel 2014 复制 r=.53–.55、Riedl 2021 确认并中介女性比例。但 Bates & Gupta 2017 潜变量不显著、Rowe 2024 不显著、Blanchard 2025(两人组)只剩"少量调味"。方向大体为正、量级缩水、对任务类型和群体规模敏感。
- 「发言轮换均匀度是预测因子」=倒了(原始形式)。 原始证据本就单薄(n=46 佩戴徽章组);Rowe 2024 反向不显著;Riedl 2021 显示预测力属于更丰富的"协作过程"变量(技能匹配、策略、努力),不是简单轮流。作为"协作过程质量"的粗糙代理被取代,不是被平反。
能不能当主轴三的实证基石?——不能当基石,能当"有条件的测量传统 + 活跃研究纲领"。 一个连自己最核心卖点(独立于个体 IQ——Bates & Gupta 2017 反而发现个体 IQ 解释约 80% 团体 IQ 差异)都没稳定复现、80% 研究效力不足的构念,不能做地基。主轴三的实证地基应分散到四条独立线的收敛上,任何单独一条都撑不起:c 因子(条件版)+ 交易过程(transactive processes:集体记忆/注意/推理,Woolley & Gupta 2024)+ Tomasello 联合注意一脉 + 指称游戏对齐实验(本条目 §一)。它的边界条件研究(任务结构)和人机团队延伸(COHUMAIN 纲领、Gonzalez 2026 互补性框架、Farach 2026 Gap Inc. 388 人现场实验——强制共用 AI 的"行为脚手架"反降产出、"思想伙伴"式认知脚手架提质量)是活的研究纲领。
七、协议防销蚀的药方(2026-07-18)——药在机制层,不在协议形式层
开放问题 1b:什么样的交互协议能保住多样性不被 drift/回音室吃掉?文献只证了病(§二§三),这次专门找药,也找"药无效"的证据。
裁决:药部分找到,但找到的药不在"协议形式"这一层,在生成/选择机制层。
- 有硬实证的药(域内):① Quality-Diversity(QD)家族——MAP-Elites 把行为空间切格、每格保精英,novelty search 奖励新颖度,证明"多样性保持可以结构性内建进选择机制,不靠事后过滤或道德劝说"(代价:档案库规模随维度指数增长);② Verbalized Sampling(arXiv 2510.01171)——让模型显式说出"回复+概率"分布再采样,创意写作场景多样性提升 2–3 倍、不牺牲质量、跨模型有效、更强模型获益更多。机制解释:persona collapse 直接来自 RLHF 优化几何(联合奖励最大化 + KL 正则化制造"助手模式"强吸引子),所以表层的角色提示拉不动底层被 RLHF 拉紧的吸引子——这解释了"给不同 agent 分配不同人格提示"这种朴素角色异质化为何经常不 work。两种药的共同点:干预的是生成/选择机制,不是交互礼仪。
- 被证无效或仪式化的:① 角色扮演式异议(devil's advocate)——Nemeth 2001 系列实验,指派的反对诱发的是对原立场的认知加固(cognitive bolstering),不是发散思考;起效关键是"被感知为真心持有立场",协议分配的角色恰恰缺这一环(人类侧最硬的"药无效"证据)。② 同质 agent 辩论——Demystifying Multi-Agent Debate(arXiv 2601.19921,摘要 Fable 一手核):"under homogeneous agents and uniform belief updates, debate preserves expected correctness and therefore cannot reliably improve outcomes"——同质 + 均匀信念更新两个假设下,辩论只是保持期望正确率、防不了销蚀。③ 无闭环的 red team 退化为 security theater。④ Delphi 法是半世纪悬案(Sackman 1974 起的指控——共识可能是统计反馈制造的从众压力换皮——至今未收口)。
⭐ Fable 终裁在 K3 之上补的一层(一手核鞅论文摘要发现):那篇鞅论文的"无法改进"结论压在两个假设上——同质 AND 均匀信念更新。而论文自己的贡献恰恰是打破第二个假设:confidence-modulated updates(智能体表达校准过的置信度、并据他人置信度调整更新)让辩论能系统性漂向正确假设。所以防销蚀的机制层杠杆不止一根:除了"真实的(非指派的)异质性",还有"打破均匀信念更新——置信度校准通信"这第二根。这跟本条目 §一 的三条件③(反应改写下一轮生成)血脉相通:置信度调制正是一种"让反应真正改写更新动态"的协议设计。
claim 置信度变化:原形式"交互协议(作为形式)能防止多样性销蚀"——低,且正朝被证伪方向移动(人类侧 Nemeth + 机器侧鞅结果两条独立证据同向)。修正形式"防销蚀的有效干预存在,但作用于机制层而非协议形式层:真实(非指派)异质性 + 打破均匀更新的置信度校准 + 结构性焅入多样性(QD)+ 闭环修复"——中。这给 1b 一个可设计的下一步:把 QD 式档案或稀疏拓扑搬进 multi-agent LLM 长期交互实验,是这片空白里最值得做的那个实验(花园最关心的因果链——结构化协议 → 减少 multi-agent drift——目前没有任何一篇论文直接测过;诊断已细化到结构变量:模型对齐度/权威结构/通信拓扑密度,arXiv 2604.18005,摘要 Fable 一手核)。
演化痕迹
2026-07-14(session #1):建园当天首次 research。把「假设·未核验」的三条件对齐协议假设核验为"站得住,带两处修正"(②有最硬因果证据;③有饱和边界;三条件是我们的映射不是文献清单),并用机器侧证据把开放问题 #1 从二选一重构为"多样性供给信息、协议防销蚀"的分工框架。
可能错在哪:机器侧结论几乎全部依赖 2024-2026 预印本(仅 EMNLP/ICLR/ACL 三篇经过同行评议),且"同质 debate 无用"的实验多在 QA/推理 benchmark 上做——若未来在开放性任务(设计、研究、写作)上出现"同质多实例真交互显著优于独立采样"的对照证据,"协议以异质性为前提"这条要降级为"仅在封闭任务成立"。另外"协议防销蚀"是我的综合命名,尚无文献直接以此为实验假设检验过。
2026-07-14 晚(同日,loop 园 research #2 回打):当天晚上 loop 园按新方法跑 Q2(异构互审),Kimi 对抗路挖出的证据直接打到本条目的"协议的价值以异质性为前提":①错误相关性实测——前沿模型(GPT-4o/Claude/Gemini)错误相关 r≈0.77(arXiv 2605.00844),350+ 模型测量显示越强越相关(ICML 2025,2506.07962)——异质性买到的独立性是打折的,因为各家训练数据同源(同一个互联网);②文献正面冲突——本条目引的 X-MAS(异质系统性更优)与 Self-MoA(2502.00674,同质最强多采样胜异构混合)、M3MAD(2601.02854,异构 debate 不超最佳同质)结论相反,可能的调和变量是"异质组合的质量",未证。"以异质性为前提"仍成立(同质协议空转的证据没被动摇),但"引入异质性=拿到独立视角"要降级为"拿到打折的独立性"——异质先验供给的新信息量上限由实际错误相关度决定,不由"家族不同"这个名义决定。详见 loop 园 landscape/heterogeneous-review.md;冲突登记为两园共挂的活问题(loop Q2b)。
可能错在哪:错误相关性只测过 QA/预测类任务;若主观评估任务上家族间相关性实测很低,"打折"幅度要收窄。
2026-07-15(骨架批次补跑,session: 086b55d1):一篇被上一批次漏掉的论文(POLIS,The Ratchet Effect in Silico,arXiv 2507.21166)——多个异质小模型纯靠"出题-同伴核验-内化"循环把数学成绩大幅拉升——表面上直接打死判据环(关起门自己聊天,智能就涨了)。裁决:判据没被推翻,是措辞太窄。新增 §五:循环外的输入有两种形态——新数据(望远镜带回的光子)与验证信号(世界对"你说得对不对"的裁决,不给内容只给一个不可被内部意见改写的比特)。有裁判的领域(数学/代码/棋)后者可撑起自举(AlphaZero、RLVR 那条已被大规模验证的线),没裁判的领域协议退回只能防销蚀。精确化之后判据环更强:它现在能解释旧措辞解释不了的事——为什么同一套多智能体架构在数学上能涨、在开放任务上会退化成回音室。
这条精确化的把柄:POLIS 架构原样搬到没有客观裁判的任务(写作/设计/评论)上,增益应显著缩水甚至变负。做出来增益照样大,这条就错了。
论文本身不进证据链:单作者在读学生、零第三方引用、无误差棒无代码、训练题与评测集污染未排除、异质 vs 同质对照的规模变量未解耦(4 vs 3)。精确化的根据是 AlphaZero/RLVR 那条独立证据线,不是这篇论文——它的功劳只是把洞指出来。
它自己也是一个反面教材:Introduction 用窄定义的棘轮("防止倒退",引 Dean 2012/Tennie 2009)背书,Related Work 却把它框成达尔文式"变异-选择-遗传",而系统里掉分最多的正是主动择优的机制——一边引窄定义背书、一边用宽定义干活,正是本园刚纠正过的那类方向性滑移的活案例。
本条目是持续修剪的「当前理解」——只有最新版有意义。由花园研究与真实对话共同长成。 回赠(指出错误/补充证据):见 协议页。