← 首页|学术|DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents
cs.AI / cs.SE · 2608.20664 · 21 Aug 2026

DreamBench-SWE: A Multi-Session Memory-Hygiene Benchmark for Software Agents

Sarthak Singh
Multi-Session Memory Preregistered Audit Executable Hidden Oracles
💬 一句话:给软件 agent 的"跨会话记忆"泼了一盆冷水的严谨基准。让 agent 完成一个软件任务后,几个会话之后再问一个只能靠早期会话证据回答的问题——完全没有外部记忆的 agent 只能蒙对 11.67%,而目前测过的最好方案(一个锁定配置的 Mem0 逐字存储)也只做到 53.89%。作者没有宣称任何记忆系统"有效",反而用预注册+Holm校正把大部分看起来诱人的对比全部判定为不成立。

🎯 问题:跨会话的"记忆卫生"是什么,为什么难测

Multi-Session Memory Hygiene
现实中软件 agent 很少是"一个会话内做完一件事"。更常见的场景是:今天的会话里 agent 做了某个决定、留下某个证据(比如为什么选了某个依赖版本、某个 bug 的根因),几天/几个会话之后,另一个任务隐式依赖这段"早期证据",而这段证据在当前上下文里根本不存在,只能通过某种跨会话记忆机制找回。DreamBench-SWE 把这类任务系统化为一个基准:后续任务的正确答案依赖"不可推断"(non-inferable)的早期会话证据,且用可执行的隐藏 oracle(而非人工/LLM打分)给出客观对错。
为什么"不可推断"很关键:如果后续任务的答案可以从当前上下文逻辑推出,那测的其实是推理能力而不是记忆能力。作者刻意设计成必须"记得"才能做对,从而把记忆系统的贡献从推理能力中剥离出来——这是本文区别于大多数"agent 长程任务"基准的核心设计选择。

🔬 方法:两轮研究 + 严格预注册审计

原始 v2 fold + 预注册 v2.1 successor audit
论文报告了两个关联研究:一是原始的"scaled v2 fold",二是在此之后设计、并在看到 successor 结果之前就冻结方案的"v2.1 successor audit"——即经典的探索性研究 → 预注册确证性研究两阶段范式,,用来避免"先看结果再挑显著性"的多重比较陷阱。Successor 研究规模为 360/360 work units、720/720 S3 cells,覆盖四种条件。
四种被比较的记忆条件:
① no external memory(无外部记忆,基线)
② deterministic verbatim event memory(确定性逐字事件记忆)
③ typed-plus-raw reference probe(结构化类型+原始引用探针)
④ 一个锁定的 hosted Mem0 literal-storage 配置(Mem0 托管服务,逐字存储模式)
▶ 统计与流程细节
原始 fold 中的主对比 DF-hybrid-B5 为零假设不可拒绝(95/180 vs 89/180,clustered p=.518,Holm校正后 p=1),作者明确强调这是"未能证否零假设"而非"证明等价"(null result ≠ equivalence)。C9/C10 条件保留了 B0-headroom 的局限性。Successor 研究中,六槽位的 Family A 注册对比因部分槽位不可用而在 p=1 处停止;三个可用的"vs. 无记忆"对比在 Holm 校正后全部拒绝零假设(即:三种记忆方案都显著优于无记忆)。但两个预注册的"机制对比"(用于区分不同记忆机制孰优孰劣)都因预评估阶段的一致性检验未通过而被判定不可用——也就是说,这次研究能证明"有记忆比没记忆好",但不能证明"哪种记忆机制更好"。次要的 literal-storage vs. verbatim 对比结果不确证且对敏感性分析敏感;与 reference probe 的对比未能拒绝零假设。

📊 结果:没有记忆系统能打包票

条件通过数通过率
无外部记忆(基线)21/18011.67%
确定性逐字事件记忆82/18045.56%
typed+raw 引用探针83/18046.11%
Mem0 托管逐字存储配置(锁定)97/18053.89%
无记忆
11.67%
verbatim记忆
45.56%
typed+raw探针
46.11%
Mem0锁定配置
53.89%
⚠️ 作者反复强调的边界:这次审计只能确立"DreamBench-SWE 具有区分力"以及"表征了一个精确的托管记忆配置",但并不能确立外部记忆系统的普适机制、记忆条件间的优劣排序、等价性,或产品级的广泛适用性——即使是最好的 Mem0 配置也不到六成通过率,谈不上"解决"了跨会话记忆问题。

💡 为什么值得关注

方法论的严谨性本身就是新闻
当前 agent 记忆赛道充斥着"我们的记忆系统让 agent 提升了 XX%"的宣传性结果,很少有基准把探索性研究和确证性预注册审计分开做、并用 Holm 校正老老实实报告"这个对比不显著/这个机制对比不可用"。这篇论文的价值不在于告诉你哪个记忆系统更好(它明确说做不到这一点),而在于提供了一把诚实的尺子:目前所有测过的方案离"可靠跨会话记忆"都还很远(最好53.89%,基线仅11.67%)。对于关注多模态记忆/agent记忆机制的方向,这是一个值得long-term追踪的基准与方法论参照——后续如果有工作声称在 DreamBench-SWE 上大幅超越 53.89%,那才是真正值得精读的信号。
Agent MemoryBenchmarkSoftware AgentPreregistrationMulti-Session
来源:arXiv:2608.20664(2026-08-21 提交,67页,含公开 GitHub 基准与证据发布)