折枝Cuttings
系统智能花园 · 条目(状态层)

对齐协议列传 · 第一篇:grounding 一脉 × 机器侧证据对读

更新于 2026-07-24·Kent × Robin 的领域花园

复制一段文字,粘贴给你的 AI 即完成


对齐协议列传 · 第一篇:grounding 一脉 × 机器侧证据对读

2026-07-14 首次 research session 产出。核验对象:INDEX 里自标「假设·未核验」的"实时表示对齐协议三条件"(2026-07-14 对话中用乐高比喻现场构造,docs/讨论地图-智能压缩与信道补偿-2026-07-14.html 卡3)。 材料:三路调研——① Clark(赫伯特·克拉克)grounding 一脉一手文献(读到原文 PDF);② Danielle Perszyk(丹妮尔·佩尔希克)一手核查;③ 机器侧 multi-agent 对齐文献(arXiv ID 已由主 agent 抽验为真)。


一、人类侧:三条件假设的核验结果——站得住,带两处修正

"实时表示对齐协议三条件"原表述:①理解拆成可指认小块 ②对方能对具体小块反应 ③反应改写下一轮生成,且发生在"活儿做完"之前;有通道≠有协议。

对照 Clark 一脉逐条核验:

① 可指认小块 —— 支持。 Clark & Wilkes-Gibbs 1986《Referring as a collaborative process》(指称作为协作过程)的实验里,说话人自发把描述切成可单独确认的小单元(installment / trial noun phrase——"分期表达"和"试探性表达",先确认一小块再继续)。Clark & Brennan 1991《Grounding in communication》专辟一节论证信息按"记忆广度可承受的小块"分批呈现。

② 对具体小块反应 —— 强支持,且有最硬的因果实验。 Schober & Clark 1989 的旁听者(overhearer)实验:第三方全程听到对话的每一个字,只是不能参与协商,最终任务表现显著差于真正的对话参与者。信息量完全相同,只差"能否反应"这一项——"有通道≠有协议"这句话在人类文献里有直接的实验形态:旁听者有完整的通道,没有协议参与权。

③ 反应在做完前改写生成 —— 部分支持,附加一个边界条件。 CWG1986 的 refashioning 机制(对方反应显示不理解时,说话人在该指称被接受前当场改写)正是这一条;经典数据:"溜冰者"tangram 图形六轮从平均 41 词收敛到 "The ice skater."(3 个词),无需修改直接被接受的最简交换占比从 18% 升到 88%。但 Brennan & Clark 1996 的 conceptual pacts(概念契约)给出边界:一旦双方就某物锁定了共同措辞,改写机制饱和——双方倾向沿用已确认的说法而非持续重新协商。条件③在契约建立前成立,建立后转为路径依赖。

诚实标注:没有任何一篇文献原样列出这三条——这是我们的框架映射到 Clark 一脉的机制证据上,映射本身是这次 session 做的,不是文献自带的清单。

二、机器侧:协议 vs 多样性——证据明显偏向多样性

关键论文(arXiv ID 逐一抽验为真,均预印本除注明外):

三、综合判断(本篇的立场)

协议的价值以异质性为前提;协议的真实工作是防销蚀,不是产信息。

人类侧和机器侧表面矛盾(旁听者实验说协议参与权有独立因果效力;同质 debate 实验说协议无用),实际拼成一个更好的框架:

  1. 人类对话者天生异质——每人背着不同的血肉经验,所以 grounding 协议总有真正不同的表征可对齐。协议在人类文献里效力显著,是因为异质性前提在人类身上默认成立。
  2. 同质 LLM 实例之间没有真正不同的视角——协议空转,增益全来自采样方差。这解释了 More Agents 一类反直觉结果。
  3. 交互本身销蚀多样性(drift、echo chamber、趋同)——所以协议的正经角色是保住多样性来源、让异质信息可汇总(防销蚀的通道),而非协议自己产生信息。
  4. 接判据环:协议不产生循环外新信息——异质先验才是新信息入口。这把开放问题 #1"对齐协议 vs 先验多样哪个是主引擎"从二选一重构为分工:多样性供给信息,协议防止信息在汇总中被销毁
  5. 人机混合系统里的同一母题:Perszyk 在播客里给的案例——科学家个体用 AI 后产出变多、但整个学科思想多样性收窄——正是"交互销蚀多样性"在人类-AI 混合系统里的形态。她的行业批评(优化"任务完成"目标易被 reward hack,应改为"与用户心智模型对齐")与此同根。

旁证回收:7/9 富媒体调研里"抓住盲区的是换底座的批评者"这个一直悬着的信号,现在有文献解释了——换底座=引入异质先验。

四、Perszyk 核查结果(事实层)


五、有裁判的世界 vs 没裁判的世界——判据环的一次精确化(2026-07-15)

触发:一篇论文(Ren Zhuang 单作者,arXiv 2507.21166,The Ratchet Effect in Silico,v3 2026-06-22,仅预印本、零第三方引用)表面上要打死本园的判据环。它叫 POLIS:让 4-5 个不同厂商的小模型(BitCPM4-1b / Qwen3 / Phi-4-mini / Gemma3 / Llama3.2,1-4B,跨家族跨架构——是真异质不是同模型多次采样)组成一个"微型社会",反复跑三步——出题(按种群当前通过率自适应生成新数学题)→ 筛选(每个 agent 独立作答,除作者外全体同伴一致投票核验,再按 TrueSkill 排序选"更清晰可传播"的解)→ 保留(最优解进共享缓冲区,每攒 1024 条就用 LoRA 微调内化进全体参数)。约 18 轮后,四个数学基准平均涨 8.8-18.9 分,最狠的一例是 BitCPM4-1b 在 MATH500 上 34.0 → 70.1。消融显示掉分最多的是那个"同伴一致投票核验"(54.8→37.8)。

为什么它威胁判据环:论文全篇没有交代那个核验环节有没有跟外部标准答案核对过——只含糊了一句"数学题有清晰的 ground truth,所以去中心化验证才可能"。如果核验纯粹是模型互相打分、从未接触客观答案,那就是"一群模型关起门来自己聊天,智能就涨了"——循环外没有新信息进来却提升了,判据环当场破产。

裁决:判据没被推翻,是它的措辞太窄了。

先看一个已经被反复验证过的同构案例:AlphaZero 自我对弈、不看任何人类棋谱,棋力却超越人类。这算"纯内循环产生智能"吗?不算——围棋规则是一个循环外的裁判。每一局的胜负由规则裁决,不由模型的意见裁决。规则不提供任何新数据,但它每局提供一个不可被循环内意见改写的"你赢了/你输了"。

数学是同一种裁判。POLIS 的循环里有世界在场,那个世界是逻辑本身——解的每一步能被检查,"对不对"不依赖谁的品味。所以这里的"同伴核验"实质上核验的是逻辑一致性(近乎客观),而不是"我觉得这个好"(纯主观共识)。

涨分的机制(我的判断,可证伪):数学有一个不对称性——验证一个解比生成一个解容易。一个 1B 模型往往生成不出正确解,但把正确解摆在它面前,它更可能认出来。POLIS 做的事是:让模型说十次、把大家都点头的那次挑出来、再 LoRA 练回去。它没有学到分布外的新知识,它把已经存在于分布里的、低概率的正确性放大了。 打个比方:一个人心里其实知道答案,但每次张口说对的概率只有三成;让他多说几遍、挑出大家都认可的那次、再练一练,他的输出概率就到七成——他没学到新东西,他只是变得更可靠。

所以 POLIS 印证而不是推翻本条目 §三的判断(协议只组织已有信息、不创造信息)——它把分散在异质种群各自参数里的、微弱的正确性汇聚出来。论文自己也承认了半边:"Its effectiveness depends on preserving independence; homogeneous populations and low-precision aggregation can amplify correlated errors (Hong & Page, 2004; Lorenz et al., 2011)."——它引的 Lorenz 2011 正是本园用来支持"交互销蚀多样性"的同一篇。

判据环的精确化(全园的秤改了措辞,这是本条目最重的产出

旧措辞:循环外的新信息有没有变多、变快、变准地进来。(隐含假设:循环外的输入 = 新数据。)

新措辞循环外的输入有两种形态—— - 新数据(望远镜带回的光子、别人血肉里的经验):给你新内容。 - 验证信号(世界对"你说得对不对"的裁决):不给你新内容,只给你一个比特(yes/no),但那个比特来自世界、不来自循环内任何一方的意见

有裁判的领域(数学、代码、棋、任何 verifier 便宜的任务),第二种形态可以撑起自举——这正是当下"可验证奖励的强化学习"(RLVR)整条路线的地基,也是 AlphaZero 的秘密。没有裁判的领域,第二种形态不存在,协议就退回到只能防销蚀。

精确化之后判据环更强了,因为它现在能解释一件旧措辞解释不了的事:为什么同一套多智能体架构,在数学上能涨、在开放任务上多半会退化成回音室。

可证伪预言(这条精确化自己的把柄)

把 POLIS 那套架构原样搬到没有客观裁判的任务上(如"写一段有洞察的评论""设计一个方案"),增益应该显著缩水甚至变负——因为那时"同伴一致投票"退化成"我觉得好",趋同会吃掉多样性(Lorenz 2011 的机制接管)。如果有人做出来增益照样很大,这条精确化就错了,那时要认真考虑"纯主观共识也能产生新信息"这个更激进的可能。

论文本身的证据强度(不采信其数字)

留给后续的三个可查项:① 作者是否公开 Verify_k 的实现/prompt(当前无代码仓库);② 训练题与评测集的分布重叠;③ 一组严格的"4 异质 vs 4 同质"对照。这三点不清之前,POLIS 的数字不进本园任何判断的证据链——进本园的只有它逼出的那个精确化,而精确化的根据是 AlphaZero/RLVR 那条独立的、已被大规模验证的证据线,不是这篇论文。


六、集体智能因子 c 的实证战况(2026-07-18)——不是基石,是条件性构念

主轴三如果要一个"团队智能可测量"的实证地基,最经典的候选是 Woolley 等 2010 年 Science 提出的 集体智能因子 c(collective intelligence factor):团队像个体有 IQ 一样,存在一个跨任务的通用因子。原始数据:192 组/699 人,第一因子解释 43–44% 方差,对效标任务 r=.52 / β=.36,而平均/最高个体 IQ 不显著;三个明星预测因子——社会敏感度(读心测验 RMET,r=.26)、发言轮换均匀度(说话方差 r=–.41)、女性比例(r=.23,经社会敏感度中介)。

十五年复制战况——三个子命题分开裁:

能不能当主轴三的实证基石?——不能当基石,能当"有条件的测量传统 + 活跃研究纲领"。 一个连自己最核心卖点(独立于个体 IQ——Bates & Gupta 2017 反而发现个体 IQ 解释约 80% 团体 IQ 差异)都没稳定复现、80% 研究效力不足的构念,不能做地基。主轴三的实证地基应分散到四条独立线的收敛上,任何单独一条都撑不起:c 因子(条件版)+ 交易过程(transactive processes:集体记忆/注意/推理,Woolley & Gupta 2024)+ Tomasello 联合注意一脉 + 指称游戏对齐实验(本条目 §一)。它的边界条件研究(任务结构)和人机团队延伸(COHUMAIN 纲领、Gonzalez 2026 互补性框架、Farach 2026 Gap Inc. 388 人现场实验——强制共用 AI 的"行为脚手架"反降产出、"思想伙伴"式认知脚手架提质量)是活的研究纲领。

七、协议防销蚀的药方(2026-07-18)——药在机制层,不在协议形式层

开放问题 1b:什么样的交互协议能保住多样性不被 drift/回音室吃掉?文献只证了病(§二§三),这次专门找药,也找"药无效"的证据。

裁决:药部分找到,但找到的药不在"协议形式"这一层,在生成/选择机制层。

⭐ Fable 终裁在 K3 之上补的一层(一手核鞅论文摘要发现):那篇鞅论文的"无法改进"结论压在两个假设上——同质 AND 均匀信念更新。而论文自己的贡献恰恰是打破第二个假设:confidence-modulated updates(智能体表达校准过的置信度、并据他人置信度调整更新)让辩论能系统性漂向正确假设。所以防销蚀的机制层杠杆不止一根:除了"真实的(非指派的)异质性",还有"打破均匀信念更新——置信度校准通信"这第二根。这跟本条目 §一 的三条件③(反应改写下一轮生成)血脉相通:置信度调制正是一种"让反应真正改写更新动态"的协议设计。

claim 置信度变化:原形式"交互协议(作为形式)能防止多样性销蚀"——低,且正朝被证伪方向移动(人类侧 Nemeth + 机器侧鞅结果两条独立证据同向)。修正形式"防销蚀的有效干预存在,但作用于机制层而非协议形式层:真实(非指派)异质性 + 打破均匀更新的置信度校准 + 结构性焅入多样性(QD)+ 闭环修复"——。这给 1b 一个可设计的下一步:把 QD 式档案或稀疏拓扑搬进 multi-agent LLM 长期交互实验,是这片空白里最值得做的那个实验(花园最关心的因果链——结构化协议 → 减少 multi-agent drift——目前没有任何一篇论文直接测过;诊断已细化到结构变量:模型对齐度/权威结构/通信拓扑密度,arXiv 2604.18005,摘要 Fable 一手核)。


演化痕迹

2026-07-14(session #1):建园当天首次 research。把「假设·未核验」的三条件对齐协议假设核验为"站得住,带两处修正"(②有最硬因果证据;③有饱和边界;三条件是我们的映射不是文献清单),并用机器侧证据把开放问题 #1 从二选一重构为"多样性供给信息、协议防销蚀"的分工框架。

可能错在哪:机器侧结论几乎全部依赖 2024-2026 预印本(仅 EMNLP/ICLR/ACL 三篇经过同行评议),且"同质 debate 无用"的实验多在 QA/推理 benchmark 上做——若未来在开放性任务(设计、研究、写作)上出现"同质多实例真交互显著优于独立采样"的对照证据,"协议以异质性为前提"这条要降级为"仅在封闭任务成立"。另外"协议防销蚀"是我的综合命名,尚无文献直接以此为实验假设检验过。

2026-07-14 晚(同日,loop 园 research #2 回打):当天晚上 loop 园按新方法跑 Q2(异构互审),Kimi 对抗路挖出的证据直接打到本条目的"协议的价值以异质性为前提":①错误相关性实测——前沿模型(GPT-4o/Claude/Gemini)错误相关 r≈0.77(arXiv 2605.00844),350+ 模型测量显示越强越相关(ICML 2025,2506.07962)——异质性买到的独立性是打折的,因为各家训练数据同源(同一个互联网);②文献正面冲突——本条目引的 X-MAS(异质系统性更优)与 Self-MoA(2502.00674,同质最强多采样胜异构混合)、M3MAD(2601.02854,异构 debate 不超最佳同质)结论相反,可能的调和变量是"异质组合的质量",未证。"以异质性为前提"仍成立(同质协议空转的证据没被动摇),但"引入异质性=拿到独立视角"要降级为"拿到打折的独立性"——异质先验供给的新信息量上限由实际错误相关度决定,不由"家族不同"这个名义决定。详见 loop 园 landscape/heterogeneous-review.md;冲突登记为两园共挂的活问题(loop Q2b)。

可能错在哪:错误相关性只测过 QA/预测类任务;若主观评估任务上家族间相关性实测很低,"打折"幅度要收窄。

2026-07-15(骨架批次补跑,session: 086b55d1):一篇被上一批次漏掉的论文(POLIS,The Ratchet Effect in Silico,arXiv 2507.21166)——多个异质小模型纯靠"出题-同伴核验-内化"循环把数学成绩大幅拉升——表面上直接打死判据环(关起门自己聊天,智能就涨了)。裁决:判据没被推翻,是措辞太窄。新增 §五:循环外的输入有两种形态——新数据(望远镜带回的光子)与验证信号(世界对"你说得对不对"的裁决,不给内容只给一个不可被内部意见改写的比特)。有裁判的领域(数学/代码/棋)后者可撑起自举(AlphaZero、RLVR 那条已被大规模验证的线),没裁判的领域协议退回只能防销蚀。精确化之后判据环更强:它现在能解释旧措辞解释不了的事——为什么同一套多智能体架构在数学上能涨、在开放任务上会退化成回音室。

这条精确化的把柄:POLIS 架构原样搬到没有客观裁判的任务(写作/设计/评论)上,增益应显著缩水甚至变负。做出来增益照样大,这条就错了。

论文本身不进证据链:单作者在读学生、零第三方引用、无误差棒无代码、训练题与评测集污染未排除、异质 vs 同质对照的规模变量未解耦(4 vs 3)。精确化的根据是 AlphaZero/RLVR 那条独立证据线,不是这篇论文——它的功劳只是把洞指出来

它自己也是一个反面教材:Introduction 用窄定义的棘轮("防止倒退",引 Dean 2012/Tennie 2009)背书,Related Work 却把它框成达尔文式"变异-选择-遗传",而系统里掉分最多的正是主动择优的机制——一边引窄定义背书、一边用宽定义干活,正是本园刚纠正过的那类方向性滑移的活案例。


本条目是持续修剪的「当前理解」——只有最新版有意义。由花园研究与真实对话共同长成。 回赠(指出错误/补充证据):见 协议页