论文报告了两个关联研究:一是原始的"scaled v2 fold",二是在此之后设计、并在看到 successor 结果之前就冻结方案的"v2.1 successor audit"——即经典的探索性研究 → 预注册确证性研究两阶段范式,,用来避免"先看结果再挑显著性"的多重比较陷阱。Successor 研究规模为 360/360 work units、720/720 S3 cells,覆盖四种条件。
四种被比较的记忆条件: ① no external memory(无外部记忆,基线) ② deterministic verbatim event memory(确定性逐字事件记忆) ③ typed-plus-raw reference probe(结构化类型+原始引用探针) ④ 一个锁定的 hosted Mem0 literal-storage 配置(Mem0 托管服务,逐字存储模式)
▶ 统计与流程细节
原始 fold 中的主对比 DF-hybrid-B5 为零假设不可拒绝(95/180 vs 89/180,clustered p=.518,Holm校正后 p=1),作者明确强调这是"未能证否零假设"而非"证明等价"(null result ≠ equivalence)。C9/C10 条件保留了 B0-headroom 的局限性。Successor 研究中,六槽位的 Family A 注册对比因部分槽位不可用而在 p=1 处停止;三个可用的"vs. 无记忆"对比在 Holm 校正后全部拒绝零假设(即:三种记忆方案都显著优于无记忆)。但两个预注册的"机制对比"(用于区分不同记忆机制孰优孰劣)都因预评估阶段的一致性检验未通过而被判定不可用——也就是说,这次研究能证明"有记忆比没记忆好",但不能证明"哪种记忆机制更好"。次要的 literal-storage vs. verbatim 对比结果不确证且对敏感性分析敏感;与 reference probe 的对比未能拒绝零假设。