cs.CL · 2608.24004 · 25 Aug 2026
AgentSpec: Speculative Decoding for Batch Inference of LLM Agents
Xin Wang, Ziming Miao, Yi Zhu, Hui Shen, Zhongwei Wan, Fan Yang, Mi Zhang
💬 投机解码在大 batch 场景下会失灵——推测 token 拒绝率高、动态 token 预算又用不满。AgentSpec 针对 agent 工作流的结构特点重新设计投机解码,两个改动都利用了"agent 流程有结构"这一点。
投机解码在大 batch agent 推理下的两个失灵点
LLM agent 应用的响应时间开销很高;常规投机解码方法在大 batch size 下会退化,原因有二:(1) 推测 token 的拒绝率高,(2) 动态 token 预算利用不充分。