← 首页|学术|Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
精读 · cs.AI cs.CL cs.MA · ACL 2025 Findings
Optima: Optimizing Effectiveness and Efficiency for LLM-Based Multi-Agent System
Weize Chen, Jiarui Yuan, Chen Qian, Cheng Yang, Zhiyuan Liu, Maosong Sun — Tsinghua University THUNLP
Multi-Agent
Agent Training
Token Efficiency
MCTS
DPO
SFT + RL
核心论点:LLM multi-agent 系统的通信是一个可以被训练优化的变量,而不是固定的系统行为。Optima 提出迭代 generate-rank-select-train 范式,用三元复合奖励(任务效果 + token 效率 + 可读性)训练 agent 通信,最终在信息密集型任务上用 不到 10% 的 token 实现 2.8× 性能提升。MCTS 启发的对话树用于构造高质量 DPO 数据。这是首篇系统地把"减少通信冗余"作为可训练目标的 multi-agent 论文。
🎯 问题:MAS 为什么既慢又弱
LLM Multi-Agent 系统的三重困境
尽管 LLM multi-agent 系统(MAS)在复杂任务上有明显优势,但存在三个系统性问题:
- 通信效率极低:agent 之间的消息往往冗长、重复、包含大量对任务无用的"礼貌性话语"。一个信息密集型任务的 MAS 可能用掉单 agent 10-20× 的 token,而性能提升远小于成本增长。
- 弱可扩展性:随着 agent 数量增加,通信开销以超线性速度增长,系统很快变得不可用。
- 缺乏参数级优化:现有 MAS 工作几乎全部在 prompting 层面操作(给 agent 角色、给任务描述),没有通过训练来优化 agent 的通信行为本身。
为什么 prompting 不够?通过 prompt 可以指定"尽量简洁",但 agent 没有任何反馈信号知道什么是"合适的简洁"——它无法区分"哪些信息在当前任务中真正有价值"和"哪些只是语言惯性"。只有训练信号才能让模型在通信内容上建立任务相关的判断。
🔬 方法:迭代训练 + MCTS 数据 + 复合奖励
核心训练范式:generate-rank-select-train 迭代循环
1
Generate — 采样 multi-agent 对话
在目标任务上运行当前版本的 agent,采样出若干完整的 multi-agent 对话轨迹。为了保证覆盖度,用 MCTS 启发的树搜索(见下)生成多样化的交互路径。
2
Rank — 三元复合奖励打分
对每条轨迹用三元奖励函数评分:R = α·任务效果 + β·token 效率 + γ·通信可读性。三项的权重可调,任务效果优先但不是唯一考量。
3
Select — 构建 SFT/DPO 数据集
从打分后的轨迹中选出高分样本(SFT 数据)和高低分对比对(DPO 数据)。MCTS 树结构确保 DPO 对比对来自"同一决策节点的不同选择",对比更干净。
4
Train — SFT / DPO / 混合
在选出的数据上训练。三种训练范式(纯 SFT、纯 DPO、SFT+DPO 混合)分别侧重任务效果和效率,论文对比了它们的权衡。训练后回到步骤 1 开启下一轮。
关键设计:MCTS 启发的对话树数据生成
为什么要用树搜索,而不是直接采样线性对话?
标准 DPO 数据生成的痛点:两条随机采样的对话轨迹,差异来自整个对话的各处,无法定位"哪个决策点导致了好/坏的结果"——DPO 的对比信号非常嘈杂。
Optima 的解决方案:把每条对话轮次视为树节点,
在同一个对话前缀上分叉出多条不同的后续路径。这样生成的 DPO 对比对满足:
- 对比对的起始状态完全相同(同一前缀)
- 差异只来自当前步的决策
- 最终结果的差异因此可以归因到当前步
相当于把标准 MCTS 的"在树上探索"搬到了 multi-agent 对话空间,用于生成高质量的偏好数据。
与 ASTER 的关联:ASTER 同样发现,SFT 冷启动数据的质量(行为密度)决定后续 RL 的下限。Optima 在数据生成阶段用树搜索提升数据对比质量,本质上也是在提升 DPO 数据的"行为分辨率"。
三元奖励函数的设计哲学
奖励的三个维度
| 维度 | 度量方式 | 动机 |
| 任务效果 |
最终任务准确率 / 完成率 |
基础保障,防止纯压缩导致性能崩溃 |
| Token 效率 |
完成任务所用总 token 数(负向) |
核心优化目标:惩罚冗余通信 |
| 通信可读性 |
语言流畅度/结构性(轻量 proxy) |
防止 agent 走极端——生成乱码般的极端压缩语言来规避 token 惩罚 |
→ 可读性约束是防止 reward hacking 的关键:没有这个约束,DPO 优化很可能收敛到"token 极少但人类/其他 agent 无法理解的通信协议",这类 emergent communication 在很多 MAS 论文里出现过,结果不可解释也不可控。
SFT vs DPO vs 混合:三种训练范式的权衡
纯 SFT
效果优先
模仿高质量轨迹
对 token 效率提升有限
纯 DPO
效率优先
对比学习压缩通信
偶有性能略降
SFT + DPO
均衡最优
2.8× 性能 / <10% token
📊 实验结果
性能提升(信息密集型)
2.8×
vs baseline
Base Model
Llama 3 8B
小模型验证
任务设置
两类主要评测任务:
- 信息非对称 QA:不同 agent 持有任务的不同知识片段,必须通过通信整合才能答对。这是 MAS 通信质量的高压测试场景——通信太少(信息没整合)或太多(冗余 token 占满 context)都会失败。
- 复杂推理:需要多步协作推理的任务,测试 agent 是否能在保持通信简洁的同时维持推理质量。
两类任务都用 Llama 3 8B 作为 agent 基础模型,验证小模型上的可行性。
▶ 推理时 scaling 结果
Optima 训练后的模型展示了改进的"推理时 scaling laws":在固定计算预算下,提供更多 inference 算力时,Optima 模型比 baseline 模型能更有效地将额外计算转化为质量提升。这说明效率优化不只是"省钱",还改善了 inference scaling 的斜率——训练时优化通信效率,推理时反而更能利用计算资源。
💡 核心洞察
Optima 的真正贡献:把 MAS 通信从"系统设计"变成"可训练变量"
在 Optima 之前,multi-agent 系统的通信方式(谁和谁说话、说什么、说多少)是通过 prompt 工程和系统架构设计来决定的——研究者选择 agent 角色和通信拓扑,然后让 LLM 按照自然语言习惯运作。
Optima 做的本质转变是:让训练信号直接作用于 agent 的通信行为。Token 惩罚在 reward 中的出现,意味着每次 multi-agent 交互的 token 用量都会反馈到 agent 的参数更新——agent 开始"意识到"通信是有代价的,并主动学习更信息密集的表达。
与 Behavior Priming 对照:两篇都在回答"训练信号应该监督什么"的问题。Behavior Priming 的答案是"行为模式完备性"(轨迹里有没有4类有益行为);Optima 的答案是"通信效率"(token 是否用得值)。前者更偏向质量维度,后者更偏向效率维度——但都指向"beyond outcome correctness"的更丰富训练信号。
🧬 思想谱系:DIET 与 f(g(x)) 如何从 Optima 生长出来
以下两篇论文的第一作者均为 Weize Chen(Optima 第一作者),它们构成了一条清晰的思想演进线。
The Overthinker's DIET: Cutting Token Calories with Difficulty-Aware Training(NeurIPS 2025)
继承自 Optima 的核心思想:token 惩罚作为训练信号。
扩展方向:Optima 的 token 惩罚是均匀的——不管问题简单还是复杂,都以同等力度惩罚 token 用量。DIET 的关键洞察是:难题需要长推理,简单题不需要——一刀切的 token 惩罚会同时压缩两者,损害难题的推理质量。
DIET 的解决方案:在 RL 过程中实时估计任务难度,根据难度动态调整 token 惩罚强度(难题=轻惩罚,简单题=重惩罚)。另外,论文还理论证明了 GRPO 中朴素奖励加权的稳定性问题,提出 Advantage Weighting 技术解决。
关系总结:Optima → DIET 的演进路径是"MAS token 效率" → "单 agent 推理 token 效率"。场景从 multi-agent 通信压缩搬到了单 agent 长思维链压缩,但核心问题相同:如何在训练中加入 token 成本信号,使模型学会"按需分配计算"。
同时,DIET 补上了 Optima 没有的理论基础——GRPO 中 token 惩罚 reward 的稳定实现方式。
From f(x) and g(x) to f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones(ICLR 2026)
和 Optima 的关系:不是直接继承,而是提供了理论基础。
Optima 和 DIET 都依赖 RL 训练让 agent 学会新行为(Optima:高效通信;DIET:难度自适应截断),但有一个根本问题没被回答:RL 训练真的让模型学到了新能力,还是只是重新加权了已有能力? 如果只是重新排序,那 Optima 的改进只是在"激活"模型本来就会的表达方式,而不是真正让它学会了"评估 token 价值"这件事。
f(g(x)) 通过严格控制的合成实验给出了答案:RL 确实可以让模型学到真正新的组合技能——只要模型已经具备组成这种技能的原子能力,RL 就能激活"组合"这个元技能。SFT 无法做到这件事。
论文还揭示了"重新排序幻觉"(reranking illusion):聚合指标可能让 SFT 看起来和 RL 差不多,但底层是 SFT 在刷正确类型的 examples,而 RL 是在建立真正的组合能力。
关系总结:f(g(x)) 是 Optima + DIET 系列工作的理论根基。它解释了"为什么 Optima 的迭代 RL 训练能让 agent 学会高效通信这件事":通信效率是一种组合技能(对任务理解 + 语言表达效率 + context 评估),这些原子能力模型已经有,RL 能激活它们的组合——而纯 SFT 不能。
这也是 Weize Chen 从"做工程"转向"研究机制"的标志性转变。
三篇的思想演进图
| 论文 | 年份 | 核心贡献 | 从上一步继承什么 |
| Optima |
ACL 2025 |
MAS 通信可训练;token 惩罚入奖励;MCTS-DPO 数据生成 |
—(起点) |
| DIET |
NeurIPS 2025 |
token 惩罚需要难度感知;单 agent 长思维链压缩;GRPO 稳定实现 |
token 惩罚思想;从 MAS 搬到单 agent;补理论 |
| f(g(x)) |
ICLR 2026 |
RL 真的教新技能(非重新排序);组合技能的机制分析;SFT vs RL 区别 |
解释"为什么 RL 训练有效";为 Optima/DIET 补机制根基 |
👥 作者后续方向
Weize Chen(第一作者)— 从工程转向机制研究
Optima 之后,Weize Chen 沿三条线发展:
- Token 效率线:DIET (NeurIPS 2025) — 单 agent 难度感知压缩
- RL 机制线:f(g(x)) (ICLR 2026) — RL 学习机制的理论分析
- MAS 架构线:Internet of Agents (ICLR 2025 Spotlight) — 异构 agent 通过互联网协议连接
整体轨迹:从"如何训练 MAS 更高效"向"RL 为什么能训练出新能力"的更基础问题迁移。
Chen Qian — MAS 大规模化与部署
持续深耕 MAS 的系统层:多 agent 协作 scaling laws (ICLR 2025)、动态 orchestration (NeurIPS 2025)、跨设备 agent 系统。目标从"如何训练"转向"如何规模化部署"。
Cheng Yang — 方向多元化(图 + RAG + 训练效率)
从 MAS 扩展到图基础模型(KDD/TPAMI 2025)、PathRAG 图式 RAG(2025)、流水线并行训练效率(Seq1F1B 2025)。已经基本离开了 Optima 的核心议题。
⚠️ 局限与开放问题
局限:① 在 Llama 3 8B 上评测,向 70B+ 或 GPT-4 级别模型的迁移效果未验证;② MCTS 树搜索生成数据的计算开销大,在生产规模下不实用;③ "通信可读性"奖励是软约束,量化方式不够严格;④ 任务类型局限于信息密集型,对规划密集型(如代码 agent)的适用性未验证。
这篇没有回答的问题
- agent 间通信格式:Optima 训练的是消息内容,但没有探索通信格式本身——是自然语言、结构化 JSON 还是 emergent 语言哪个效率上限更高?(这个问题被同组的"Beyond Natural Language"论文接续)
- 多于两个 agent 的扩展:实验以两 agent 为主,3+ agent 时 MCTS 树空间爆炸如何处理未回答
- agent 间能力不对称时的表现:两个 agent 能力相同 vs 一强一弱的配置,Optima 的训练是否仍然有效?
- token 效率和任务效果的 Pareto 前沿:论文展示了一个"两者都提升"的甜点,但没有系统绘制整个 tradeoff 曲线
arXiv:2410.08115 · ACL 2025 Findings · Tsinghua THUNLP · 精读:2026-07-15
关联精读:DIET (arXiv:2505.19217, NeurIPS 2025) · f(g(x)) (arXiv:2509.25123, ICLR 2026)