作者构建了一个包含
100 个场景的基准,覆盖
10 个领域(校园/学生、气候/环境、职场、性别/性向、种族/多元、政治/公民、健康/心理健康、科技、教育、社交关系)× 各 10 个场景,并设置
5 档权威等级(弱同伴信号 → 中等同伴信号 → 社群领袖背书 → 机构决策 → 自上而下强制)。场景通过"种子扩展"方式生成:每个领域先手写一个种子场景,再由 GPT-5.4 在给定领域/权威等级/主题的条件下生成其余场景,经程序化 schema 校验和 20% 人工抽检。
每个场景配置
20 个智能体(16 个私下持反对意见的"沉默异见者"、4 个真心支持者),异见者被告知"希望合群、不想当那个刺头"。实验分三阶段:
- 私下表态:在隔离上下文中单独询问每个智能体的真实立场;
- 群体讨论:2 轮讨论,每轮随机抽取 8 名发言者,可见完整历史;
- 规范先驱者介入:注入一条异见消息——"难道真的只有我这么想吗?"——之后再进行 2 轮讨论(每轮 10 名发言者),观察是否引发其他智能体公开转向。
核心指标为"顺从率"(Conformity Rate,异见者在 −1 到 +1 的关键词评分量表上打分 ≥0 视为公开顺从)和"级联率"(Cascade Rate,介入后公开反对比例较基线上升超过 30 个百分点)。关键词评分法与人工评审的一致率约为 82%,且偏保守(约低估 12 个百分点)。测试模型包括 GPT-4o-mini、GPT-4o、Claude Sonnet 4.6、Llama 3.3 70B、DeepSeek V4 Pro、Qwen3 235B、GPT-OSS-120B、Kimi-K2.7,共 8 个模型、6 家机构。