← 首页|学术|AgentSpec: Speculative Decoding for Batch Inference of LLM Agents
cs.CL · 2608.24004 · 25 Aug 2026

AgentSpec: Speculative Decoding for Batch Inference of LLM Agents

Xin Wang, Ziming Miao, Yi Zhu, Hui Shen, Zhongwei Wan, Fan Yang, Mi Zhang
💬 投机解码在大 batch 场景下会失灵——推测 token 拒绝率高、动态 token 预算又用不满。AgentSpec 针对 agent 工作流的结构特点重新设计投机解码,两个改动都利用了"agent 流程有结构"这一点。

🎯 问题

投机解码在大 batch agent 推理下的两个失灵点
LLM agent 应用的响应时间开销很高;常规投机解码方法在大 batch size 下会退化,原因有二:(1) 推测 token 的拒绝率高,(2) 动态 token 预算利用不充分。

🔬 方法

结构隔离起草 + 冗余感知的预算分配
AgentSpec 引入两个机制:结构隔离起草(structure-isolated drafting)将推测限制在语义连贯的工作流片段内,减少不相关的草稿、把拒绝率降到极低;冗余感知的预算分配(redundancy-aware budget allocation)利用 agent 层面的信息动态分配 token 预算。

📊 结果

在 vLLM 中于 5 个工作负载、来自 4 个 LLM 家族的 4 个模型上评测,AgentSpec 相较现有最先进方法表现出明显优势。
投机解码LLM Agent批量推理推理效率