← 首页|学术|EdgeXpert:面向MoE与投机解码的内存高效端侧LLM推理加速器
cs.AR · cs.CL · cs.LG · 2608.05303 · 提交于 2026年8月5日

EdgeXpert:面向混合专家与投机解码的内存高效端侧LLM推理加速器
EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding

Sangwoo Ha, Hyunwoo Seo, Yurim Jo, Youngjin Moon, Hoi-Jun Yoo — 韩国科学技术院(KAIST)
💬 一款软硬件协同设计的端侧LLM加速芯片,专门解决"投机解码"和"MoE稀疏激活"这两种主流加速技术组合使用时的不兼容问题。通过prefill阶段的"按prompt复用专家"和decode阶段的"深度感知专家合并"两项机制,在三星28nm工艺、800MHz下实现相比现有工作最高56.3%的延迟降低和44.1%的能耗降低,且精度基本无损。

🎯 问题

投机解码与MoE组合使用时的外部内存访问瓶颈
端侧LLM部署的核心瓶颈是FFN层的外部内存访问(EMA)。投机解码(每步生成多个token,减少解码步数)和MoE(稀疏激活专家,降低单步计算成本)分别是缓解这一瓶颈的两种有效技术,但作者发现二者组合使用时会产生根本性的不兼容:投机解码需要一次性验证多个候选token,而MoE每个token可能路由到不同专家,导致需要同时加载的专家集合急剧膨胀,抵消了MoE本应带来的内存访问节省。

🔬 方法

Prefill阶段:按prompt复用专家;Decode阶段:深度感知专家合并
EdgeXpert是一款软硬件协同设计的LLM加速器,包含两个阶段的针对性机制。在prefill阶段,"prompt级专家复用"将路由方式从逐token独立选择专家重新表述为prompt级别的专家复用:用一个轻量级编码器识别重要token,据此构建一个共享专家集合,而对不那么重要的token则用缩减后的专家预算进行路由,从而降低专家部分的外部内存访问。
decode阶段,"深度感知专家合并"利用同深度候选token之间的上下文相似性和互斥性:不再加载所有候选token所需专家通道的并集,而是只加载显著(salient)的通道,并通过计算校准(computational calibration)在不增加额外内存访问的前提下恢复精度损失。

📊 结果

三星28nm流片验证:最高56.3%延迟降低、44.1%能耗降低
该加速器在三星28nm工艺、800MHz频率下完成综合(synthesized),相比现有工作实现最高56.3%的延迟降低和44.1%的能耗降低,同时保持接近基线水平的精度(near-baseline accuracy),即精度损失可忽略。

💡 我的看法

这是一篇硬件加速器论文,与你关注的duplex agent交互架构、LLM agent设计没有直接的方法论关联,这里给出独立评估。这篇论文抓住的问题很实际:投机解码和MoE都是当前LLM推理加速的主流手段,但两者组合时的"专家集合膨胀"问题在纯软件层面很难优雅解决,需要真正深入到内存访问模式做软硬件协同设计才能兼得两者的收益,这个问题定义本身是有价值的、切中端侧部署的真实痛点。技术方案上,"prompt级专家复用"和"深度感知专家合并"这两个机制分别针对prefill和decode两个不同计算特征的阶段设计,体现了对LLM推理两阶段差异的精细理解,而非一刀切的通用优化。局限性在于:这是一篇流片综合仿真(synthesized)结果而非真实芯片流片测试数据,56.3%/44.1%这类数字通常在从RTL仿真到实际芯片会有一定折损,需要谨慎看待其可复现性;另外"近基线精度"缺乏具体数值,"prompt级专家复用"这种粗粒度路由策略在长文本或专家分布高度倾斜的场景下是否会显著损失模型质量,也是需要在正文里核实的关键点。对于关注端侧duplex agent部署(如果未来涉及本地低延迟推理)的读者,这类"投机解码+MoE"软硬协同的思路提供了一个降低端侧推理延迟的参考方向,但目前看更偏工程实现层,与duplex的交互层设计本身关联有限。
Edge InferenceMixture-of-ExpertsSpeculative DecodingHardware AcceleratorLLM Inference
来源: arXiv:2608.05303