← 首页|学术|多智能体LLM系统推理时并行的两层视角
cs.MA · cs.AI · 2608.05791 · 提交于 2026年8月6日

多智能体LLM系统推理时并行的两层视角
A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems

Zihan Xu, Haolin Tian, Hai Jiang
💬 论文把多智能体LLM系统的推理时并行拆成两层——任务级探索多条完整解题路径的"副本并行",与单条解题路径内部任务分解并发执行的"结构并行"——并提出统一框架TIPEX对两者进行协调。在GAIA基准上的系统实验发现,中等难度任务从两种并行的协同中获益最大,而一味加大并行力度并不总能带来更好效果。

🎯 问题

并行策略缺乏统一组织与系统研究
LLM驱动的多智能体系统在推理阶段通常需要多次模型调用和复杂协调,其执行策略直接影响系统的准确率、延迟与计算成本。并行执行是提升推理时效率的一种手段,但现有工作往往只孤立地使用某一种并行形式,缺少对不同并行形式的角色及其相互关系的系统性研究,也没有统一的组织与协调方式,导致无法系统地组合、比较不同并行策略与参数配置。

🔬 方法

两层并行建模 + TIPEX统一执行框架
作者从推理时执行的视角,将多智能体系统中的并行建模为两个不同层次的决策过程:副本并行(Replica Parallelism)在任务层面探索多条完整的解题路径;结构并行(Structural Parallelism)则通过任务分解,在单条解题路径内部实现并发执行。基于此,论文提出 TIPEX——一个可控的执行框架,在统一的执行语义下整合这两层并行,协调它们在推理过程中的角色,并支持对不同并行策略与参数配置进行系统组合与分析。

📊 结果

并行提升准确率与延迟,但代价是token消耗增加
在 GAIA 基准上的系统实验表明,推理时并行能显著提升准确率并降低端到端延迟,但代价是token消耗增加。
两种并行呈互补效应,中等难度任务收益最大
进一步分析显示,副本并行与结构并行在不同任务复杂度下表现出互补效应,中等难度任务从两者的协同中获益最多;而过度激进的并行策略并不必然带来更好的性能,说明并行力度需要与任务复杂度相匹配,而非一味加码。

💡 我的看法

这篇论文的"两层并行"划分本质上是在给多智能体系统的推理时计算扩展(inference-time scaling)建立一套坐标系——副本并行对应"多次独立采样再投票/选优",结构并行对应"任务分解后的流水线/并发子任务执行",这与duplex agent里"多路并发处理不同信息流、同时维持单条主线程连贯输出"的调度问题有一定的方法论共鸣,尤其是"中等难度任务从协调中获益最大、过度并行反而无益"这一发现,提示在设计实时交互系统的并行调度策略时,盲目堆叠并发未必是正确方向,需要根据任务/对话复杂度动态调整并行粒度。不过论文本身聚焦的是离线/半离线的多智能体任务求解(GAIA基准),并未涉及实时性、流式交互或turn-taking层面的约束,与真正的全双工场景仍有距离,更多是提供了一种并行组织的思路参考而非可以直接复用的架构。
Multi-AgentInference-Time ScalingParallelismLLM Agent
来源: arXiv:2608.05791