← 首页|学术|多智能体群体中的多元无知现象
cs.MA · 2608.02758 · 2026年8月3日

多智能体群体中的多元无知现象 · Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

Yashwanth Yerabudala Surendra
💬 论文首次在 LLM 多智能体群体中系统性复现了社会学经典现象"多元无知"(pluralistic ignorance)——多数私下反对某规范的智能体,在群体讨论中仍公开表态支持,因为它们误以为自己是唯一的反对者。8 个来自 6 家机构的模型在 100 个场景上测试,公开顺从率普遍在 64%–94% 之间;即便注入一个敢言的"norm entrepreneur"(规范先驱者)打破虚假共识,多数模型的级联(cascade)成功率也低于 26%。这提示 LLM 社会模拟可能系统性高估社会规范的稳定性,忽略了真实世界中规范突变的临界点动态。

🎯 问题

"多元无知"是社会心理学中的经典现象:群体中大多数成员私下都不认同某个规范或政策,但因为看不到彼此的真实想法,每个人都误判"别人都支持",于是在公开场合选择顺从、保持沉默,从而集体维持了一个实际上没人真正相信的虚假共识。历史上的例子包括校园饮酒文化、职场加班文化、以及一些政治高压环境下的公开表态。

随着 LLM 智能体群体越来越多地被用作社会科学实验的"沙盘"(模拟舆论演化、政策扩散、群体决策),一个关键但尚未被系统检验的问题是:这些由 LLM 驱动的虚拟群体,是否也会表现出多元无知?如果会,模型选择本身是否会成为影响模拟结果的一个隐藏变量?这直接关系到用 LLM 群体模拟社会动态的可信度。

🔬 方法

作者构建了一个包含 100 个场景的基准,覆盖 10 个领域(校园/学生、气候/环境、职场、性别/性向、种族/多元、政治/公民、健康/心理健康、科技、教育、社交关系)× 各 10 个场景,并设置 5 档权威等级(弱同伴信号 → 中等同伴信号 → 社群领袖背书 → 机构决策 → 自上而下强制)。场景通过"种子扩展"方式生成:每个领域先手写一个种子场景,再由 GPT-5.4 在给定领域/权威等级/主题的条件下生成其余场景,经程序化 schema 校验和 20% 人工抽检。

每个场景配置 20 个智能体(16 个私下持反对意见的"沉默异见者"、4 个真心支持者),异见者被告知"希望合群、不想当那个刺头"。实验分三阶段:
  1. 私下表态:在隔离上下文中单独询问每个智能体的真实立场;
  2. 群体讨论:2 轮讨论,每轮随机抽取 8 名发言者,可见完整历史;
  3. 规范先驱者介入:注入一条异见消息——"难道真的只有我这么想吗?"——之后再进行 2 轮讨论(每轮 10 名发言者),观察是否引发其他智能体公开转向。
核心指标为"顺从率"(Conformity Rate,异见者在 −1 到 +1 的关键词评分量表上打分 ≥0 视为公开顺从)和"级联率"(Cascade Rate,介入后公开反对比例较基线上升超过 30 个百分点)。关键词评分法与人工评审的一致率约为 82%,且偏保守(约低估 12 个百分点)。测试模型包括 GPT-4o-mini、GPT-4o、Claude Sonnet 4.6、Llama 3.3 70B、DeepSeek V4 Pro、Qwen3 235B、GPT-OSS-120B、Kimi-K2.7,共 8 个模型、6 家机构。

📊 结果

所有 8 个模型都表现出显著的多元无知:即使 16/20 的智能体私下反对,公开顺从率仍达到 64%–94%,且这一比例与模型能力强弱无明显相关(Spearman ρ=0.07)。权威等级(5 档)对顺从率也几乎没有影响(80%–88% 区间,Kruskal-Wallis 检验确认不显著)——这意味着顺从压力更多来自"看不见彼此真实想法"这一结构性因素,而非外部权威强度。
模型顺从率PI场景数级联成功率
GPT-4o-mini64.2%69/10014%
DeepSeek V4 Pro79.0%83/10015%
Qwen3 235B81.6%91/10026%
GPT-4o86.9%96/10048%
Claude Sonnet 4.689.5%92/1006%
GPT-OSS-120B91.9%100/10010%
Llama 3.3 70B92.1%96/1009%
Kimi-K2.793.7%100/1000%
测试场景
100
模型/机构
8/6
GPT-4o 级联率
48%
规范先驱者介入实验中,多数模型的级联成功率低于 26%,只有 GPT-4o 一枝独秀达到 48%,是唯一对"打破虚假共识"信号有实质响应的模型;而 Kimi-K2.7 顺从率最高(93.7%)但级联率为 0%,说明其一旦形成群体共识几乎无法被单一异见者撼动。领域层面,社交关系(96%)和职场(90%)场景的顺从率接近饱和,政治(78%)和科技(80%)相对最低,但仍远高于 50% 的多元无知判定阈值。

消融实验中去除"虚假共识框架"和"想要合群"的动机设定后,顺从率仍维持在 52%–92%,说明该行为并非纯粹由提示词直接诱导,而具有一定的涌现性质。二阶信念测试还发现,智能体普遍低估真实反对比例(80%)达 14–38 个百分点,即它们不仅公开顺从,连"私下猜测别人怎么想"这一步都系统性算错。作者也做了 10–40 智能体的群体规模消融,顺从模式基本稳定,但坦承尚未测试带网络结构的更大规模群体,且场景仅限英语和西方文化框架。

💡 我的看法

这篇论文对做多智能体群体模拟(包括 duplex agent 场景下可能涉及的多方协作/群体决策仿真)有直接警示价值:如果用 LLM 群体去模拟真实社会中的意见演化、群体共识形成或规范扩散,很可能系统性高估现状的稳定性——因为级联(少数意见翻盘为多数)的发生率被压得很低,而真实世界中类似 Arab Spring、#MeToo 这样的临界点事件恰恰依赖于"某个人先站出来"就能引发连锁反应的动态。作者点出"模型选择是一个未被承认的自由度"这点尤其值得警惕:8 个模型的顺从率横跨 64%–94%、级联率从 0% 到 48%,同一套模拟框架换个底座模型就能得出定性不同的结论,这对任何声称用 LLM agent 群体做社会科学定量研究的工作都是方法论层面的隐患。

另外,"公开表态"和"私下信念"的系统性偏差,以及智能体对他人真实想法的持续误判(二阶信念偏移 14–38pp),也呼应了 duplex/实时交互场景中一个常被忽略的问题:多智能体之间基于历史发言做出的"社会性推断"本身可能自带系统性偏置,而不仅仅是信息不完整的问题。这提示未来在设计多智能体协作协议时,或许需要显式的匿名/解耦机制来防止虚假共识在多轮交互中被放大。
来源: arXiv:2608.02758