← 首页|学术|AgenticSTS 深读
← 返回日报
arXiv
cs.AI 2607.02255

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

AgenticSTS Team
arXiv 2607.02255 · 2026
💬 通过"有界记忆合约"将记忆组件解耦,首次让研究者可以精确控制 agent 每次决策看到什么,从而隔离研究不同记忆机制对长程任务的贡献。

🎯 问题

当前 long-horizon agent 的记忆实现几乎都采用同一模式:把所有历史观测、工具调用、反思追加进每次决策的 prompt。这导致两个核心问题:

记忆贡献无法隔离 — 不同记忆组件(episodic memory、semantic memory、procedural memory 等)的效果混在一起,无法单独评估哪个组件对任务成功起了作用。

跨任务 transcript 带来偏差 — 历史 transcript 会让 agent "记得" 之前的上下文,而不是通过记忆检索获取,模糊了真实记忆机制的边界。

⚙️ 方法

AgenticSTS 提出有界记忆合约(Bounded-Memory Contract)

  • 每次决策从一个全新的 user message 组装,不携带历史 transcript
  • 所有记忆通过类型化检索(typed retrieval)显式注入:每类记忆(episodic、semantic、working memory 等)有独立的检索通道
  • 合约规定每次决策允许访问哪些记忆类型、多少 tokens — 这些参数可以独立控制

由此建立可控测试床:研究者可以开/关特定记忆类型,精确测量每类记忆对任务成功率的贡献。

🧪 实验

  • 在多个 long-horizon 任务上评估(具体任务类型覆盖需要多步推理和状态跟踪的场景)
  • 对比实验:全记忆 vs. 禁用特定记忆类型 vs. 传统 append-all 基线
  • 评估指标:任务完成率、记忆检索精度、token 消耗
  • 消融实验:分别控制 episodic / semantic / working memory 的有无

📊 结果

  • 传统 append-all 方法在长程任务上因 context 膨胀导致性能下降,有界合约方法更稳定
  • 不同记忆类型对不同任务类型的贡献显著不同 — episodic memory 对需要回溯历史操作的任务最关键
  • Working memory 容量是影响多步推理任务成功率的最大单因素
  • 该测试床揭示了现有主流 agent 框架在记忆管理上的隐性假设

💡 启示

为什么重要:现有 agent 记忆研究缺乏受控实验工具,导致结论难以复现。AgenticSTS 提供了第一个真正可控的基础设施。

限制:合约式记忆的真实世界部署成本较高;类型化检索需要对记忆预先分类,在非结构化任务中有局限。

对你的相关性:如果你在做 agent 训练数据合成,这个测试床可以用来评估不同记忆策略对数据收集质量的影响。

🏷 关键词

Agent MemoryLong-HorizonBounded MemoryTestbedRetrievalEpisodic Memory