🎯 问题
当前 long-horizon agent 的记忆实现几乎都采用同一模式:把所有历史观测、工具调用、反思追加进每次决策的 prompt。这导致两个核心问题:
记忆贡献无法隔离 — 不同记忆组件(episodic memory、semantic memory、procedural memory 等)的效果混在一起,无法单独评估哪个组件对任务成功起了作用。
跨任务 transcript 带来偏差 — 历史 transcript 会让 agent "记得" 之前的上下文,而不是通过记忆检索获取,模糊了真实记忆机制的边界。
⚙️ 方法
AgenticSTS 提出有界记忆合约(Bounded-Memory Contract):
- 每次决策从一个全新的 user message 组装,不携带历史 transcript
- 所有记忆通过类型化检索(typed retrieval)显式注入:每类记忆(episodic、semantic、working memory 等)有独立的检索通道
- 合约规定每次决策允许访问哪些记忆类型、多少 tokens — 这些参数可以独立控制
由此建立可控测试床:研究者可以开/关特定记忆类型,精确测量每类记忆对任务成功率的贡献。
🧪 实验
- 在多个 long-horizon 任务上评估(具体任务类型覆盖需要多步推理和状态跟踪的场景)
- 对比实验:全记忆 vs. 禁用特定记忆类型 vs. 传统 append-all 基线
- 评估指标:任务完成率、记忆检索精度、token 消耗
- 消融实验:分别控制 episodic / semantic / working memory 的有无
📊 结果
- 传统 append-all 方法在长程任务上因 context 膨胀导致性能下降,有界合约方法更稳定
- 不同记忆类型对不同任务类型的贡献显著不同 — episodic memory 对需要回溯历史操作的任务最关键
- Working memory 容量是影响多步推理任务成功率的最大单因素
- 该测试床揭示了现有主流 agent 框架在记忆管理上的隐性假设
💡 启示
为什么重要:现有 agent 记忆研究缺乏受控实验工具,导致结论难以复现。AgenticSTS 提供了第一个真正可控的基础设施。
限制:合约式记忆的真实世界部署成本较高;类型化检索需要对记忆预先分类,在非结构化任务中有局限。
对你的相关性:如果你在做 agent 训练数据合成,这个测试床可以用来评估不同记忆策略对数据收集质量的影响。
🏷 关键词
Agent MemoryLong-HorizonBounded MemoryTestbedRetrievalEpisodic Memory