← 首页|学术|SkillMemo:面向组合式具身操作的专家引导技能记忆框架
cs.RO · cs.AI · 2608.05970 · 提交于 2026年8月6日

SkillMemo:面向组合式具身操作的专家引导技能记忆框架
SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

Changyuan Wang, Chubin Zhang, Zhenyu Wu 等 — 清华大学(Jiwen Lu 团队)
💬 面向具身操作策略(Diffusion Policy / VLA)的一个"技能记忆库"插件:用MoE门控隐式把长时程演示切分成原子技能,再把这些技能表示存成可检索的键值对,推理时检索最相关技能并与当前门控分布融合,作为动作预测的上下文先验。实验显示该方法在仿真与真实机器人任务上一致提升DP和VLA骨干网络,并在部分任务上超过π_0.5。

🎯 问题

大规模具身轨迹数据稀缺,导致组合泛化能力不足
Diffusion Policy 和 VLA 等具身视觉运动模型在机器人操作benchmark上表现不错,但作者指出其能力上限被大规模具身轨迹数据的稀缺性从根本上限制:模型在分布外(OOD)场景中的组合泛化能力不足,也缺乏捕捉可复用技能结构的能力。换句话说,模型往往把每条长时程演示当成一个整体记忆,而不能像人类一样把"抓取""放置""对齐"等可复用的原子技能拆出来,在新任务组合中灵活复用。

🔬 方法

MoE专家引导轨迹分割 + 技能级情景记忆库
SkillMemo 分两步走:首先用基于 Mixture-of-Experts 架构的"专家引导轨迹分割模块",通过学习到的门控系数隐式地把长时程演示划分为不同的技能原语(skill primitives),不需要显式的技能标注。然后构建一个技能级的情景记忆架构,把这些紧凑的技能表示存成可检索的键值对形式的动态记忆库。
推理阶段,记忆库检索出与当前情境最相关的技能原语,并将其与模型当前的门控分布融合,为动作预测提供一个鲁棒的上下文先验,从而帮助策略在面对未见过的任务配置组合时更好地泛化。

📊 结果

在仿真与真实机器人任务上全面提升DP/VLA骨干
论文在仿真benchmark和真实世界操作任务上进行了大量实验,结果显示SkillMemo能够一致地提升Diffusion Policy和VLA两类骨干网络的表现,取得了SOTA性能,并且超过了π_0.5这一强基线,同时在未见过的任务配置上展现出较强的组合泛化能力。摘要中未给出具体的数值提升幅度。

💡 我的看法

这篇论文属于具身操作/机器人策略学习范畴,与你关注的 duplex agent 实时交互、LLM agent 架构核心方向没有直接关联,这里给一个独立评估。其核心思路——把长时程演示隐式分解为原子技能、再用检索式记忆库做上下文先验注入——本质上是"技能级别的RAG",与近期LLM agent里"技能库/procedural memory"的思路是同构的,只是应用在了连续动作空间而非语言空间。方法上的亮点在于用MoE门控做无监督/弱监督的技能切分,避免了对技能边界做显式标注这一昂贵步骤;但这也带来一个隐忧:MoE门控学出来的"技能"边界是否真的对应语义上有意义、可解释、可复用的技能单元,还是仅仅是对训练分布的过拟合切分,论文摘要没有给出直接验证(比如可视化或人工评估技能语义一致性),这是判断该方法是否真正具备"组合泛化"能力、而非仅在训练任务的邻域内插值的关键,值得看正文是否有相应消融。总体上这是一个技术路线合理、但摘要层面证据强度中等的工作。
Embodied AISkill MemoryVLAMixture-of-ExpertsCompositional Generalization
来源: arXiv:2608.05970