cs.MA · 2608.02827 · 2026年8月3日(ICML 2026 已接收)
多智能体LLM辩论中偏见共识的相变涌现 · Emergence of Biased Consensus in Multi-Agent LLM Debates
Maya Okawa
💬 多智能体LLM辩论会放大单个LLM的偏见——但不是渐进的,而是相变式的。作者用统计物理的自旋模型(Ising/Potts)刻画辩论动力学,证明当"从众强度/噪声"比值 λρN/T 超过临界阈值时,群体会突然从中立跳变到集体偏见共识;异质性(混合不同模型/温度)能软化这个尖锐转变。理论预测在投资决策和LLM-as-judge两个真实任务上都得到验证。
🎯 问题
多智能体LLM辩论(多个agent互相看到彼此输出、迭代修正判断)已被广泛用于提升决策任务和推理基准上的表现,但其安全性/公平性风险尚未被系统刻画:交互过程本身可能放大单个LLM原有的偏见,而不仅仅是稀释噪声、逼近真相。已有工作大多零散地报告"辩论后偏见变大/变小"的实证现象,缺乏一个能预测"什么条件下偏见会突然爆发"的定量理论。本文要回答的核心问题是:多智能体辩论中,群体从中立状态滑向集体偏见共识,是否存在一个可预测的临界条件,以及哪些因素能抑制这种滑坡。
🔬 方法
物理相变类比:Ising / Potts 自旋模型
把每个agent的表态看作一个"自旋":二元判断(是/否)对应经典 Ising 模型,多元选择(如候选人筛选)对应 q态Potts模型。每个agent i 有一个局部"认知张力"(能量)函数,由三部分构成:与邻居agent状态的一致性收益(从众项,权重为从众参数 λ)、中性先验偏好、以及初始偏见项。agent按玻尔兹曼/softmax规则概率性更新自己的表态,其中LLM的采样温度T被直接对应到统计物理中的噪声(β=1/T)——温度越低,agent越倾向"随大流"而非探索。
在均场近似下推导出群体聚合状态 m(t) 的动力学方程,得到核心临界条件:当 λρN/T ≳ 1 时(λ为从众参数、ρ为有效连接稀疏度、N为agent数、T为温度),系统从"无偏一致"相变为"偏见共识"相。有限规模系统中,这个尖锐相变会被平滑为一个"交叉区"(crossover),涨落项量级为 O(1/√(ρN))。这套框架把"辩论会不会放偏"从经验观察变成了可用少数几个参数计算的问题。
异质性的抑制机制
论文进一步把理论扩展到异质群体(不同模型/不同温度混合),得到异质均场方程——每个子群体各自的非线性响应函数被整体平均。作者的解释是:混合不同类型的agent相当于对多条不同形状的非线性激活曲线取平均,会磨平原本尖锐的相变边界,并能稳定在一个"部分一致但不极端"的中间聚合值,而不是滑向完全的集体共识。
实验设计
理论验证分两条线:合成受控实验用11个商业/开源LLM(覆盖OpenAI、DeepSeek、Llama、Mistral、Qwen五大模型家族),在二元中性符号任务和隐性偏见任务(基于Borah & Mihalcea性别角色数据集)上,系统扫描温度T与初始偏见强度(通过logit bias控制),每组配置重复多次运行取均值和标准误,观测是否出现理论预测的有限尺度交叉现象。真实任务验证则用10个GPT-4.1 Nano智能体做7轮投资推荐辩论,以及6个同质GPT-3.5/GPT-4智能体在MT-Bench样本上做LLM评委任务,检验低温/高从众条件下是否真的会快速塌缩到有偏共识,并对比同质与异质(混合温度)群体的差异。
📊 结果
相变确实存在,且对噪声敏感到"失之毫厘谬以千里"
合成实验中观测到与理论一致的有限尺度交叉:随着温度降低或从众权重升高,群体聚合状态从接近零(中立)陡然跳到接近±1(一致但可能有偏)。作者特别强调,很小的温度扰动(约ΔT≈0.1量级)就足以让系统从无偏跨越到偏见共识,这正是相变系统的典型标志——不是缓慢漂移,而是临界点附近的剧烈响应。
真实任务:投资决策与LLM评委
在投资推荐任务中,低温(T<0.5)条件下辩论群体在1-2轮内就快速形成偏见共识(表现为美股/科技股过度集中),并伴随相对全球基准的收益下降;而采用异质温度组合(多个agent温度分散在1.4-1.6区间)相比同质基线能同时降低偏见集中度、提升相对表现。LLM评委任务上观察到类似模式:异质温度混合组(温度分散在1.3-1.7)相比同质群体降低了"自我偏好偏差"(如GPT-4系模型偏爱自身输出),并提升了与人类标注的一致性准确率。
异质性收窄偏见幅度的分布
在异质群体的直接对比实验中,同质群体的聚合偏见指标m(R)取值范围较宽,混合不同模型/温度的群体则明显收窄,验证了"混合子群体能软化相变、抑制极端偏见共识"的理论预测。
💡 我的看法
这篇论文提供的是一个"何时会出事"的定量预警框架,而不只是又一份"辩论会放大偏见"的实证报告——这对多智能体/duplex agent架构设计有直接的可操作性:采样温度不是一个可以随便调低求稳定输出的旋钮,它同时也是控制群体相变临界点的关键参数。在实时全双工交互场景中,如果多个子agent(例如Interaction Layer和Thinking Layer之间,或多个并行推理分支)以低温、高连接度的方式互相"对齐",理论上就存在一个隐藏的临界阈值,一旦跨过就会突然塌缩到某个(可能有偏的)共识状态,且这个塌缩对参数扰动异常敏感——这与duplex架构里追求的"快速收敛+实时响应"目标其实存在张力:收敛越快、越确定,越接近相变边界。
更有启发性的是异质性作为"相变软化剂"的角色:论文的解决方案不是加正则化或后处理去偏,而是结构性地混合不同温度/不同模型的agent,让群体响应函数被平均、边界被磨平。这提示在设计多agent协作系统(包括辩论式验证、多分支推理投票)时,刻意引入异质性(不同的模型、不同的采样策略、甚至不同的角色prompt)可能是比事后校准更根本的偏见防御手段。不过论文的理论核心建立在均场近似和简化的连接拓扑(稀疏度ρ)上,真实agent间的信息交互远比"看到聚合状态并softmax响应"复杂,临界阈值 λρN/T≳1 在更复杂的通信拓扑(如duplex架构的异步、非全连接结构)下是否依然成立,是一个值得跟进的问题。
来源: arXiv:2608.02827 (Maya Okawa, "Emergence of Biased Consensus in Multi-Agent LLM Debates", accepted at ICML 2026)