← 首页|学术|MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
cs.CL, cs.HC · 2608.24189 · 25 Aug 2026
MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation
Ryuichi Sumida, Koji Inoue, Tatsuya Kawahara
💬 4个月、40用户、1872场会话的真实部署证明:直接问答式记忆基准分数(19.7%→70.1%)大幅波动时用户满意度却纹丝不动——同一系统在Direct QA上拿78.8%,对话里主动提及的相关事实只有7.9%,71个百分点的鸿沟才是真正决定满意度的东西。
🎯 问题
Direct QA 分数与用户满意度脱节
对话式 LLM 的记忆系统惯例上用"直接、寻事实型问题"(Direct QA)来评测:模型能否回忆起先前对话中的事实 X?作者在一次为期4个月的真实部署中(40名用户、1872场会话、7种记忆配置)检验了这个假设是否成立:Direct QA 准确率在7种配置间从19.7%大幅波动到70.1%,但用户满意度却没有随之变化。这说明现有基准和用户满意度可能在追踪两种不同的能力。
🔬 方法
MemUse:面向"自然整合"的评测集
作者提出假设:基准测量的是"被动激发式检索"(elicited retrieval,被问到才想起来),而真实对话需要的是"自然整合"(natural integration)——检测相关性并把先前语境自然地编织进当下回应,而不是等着被直接提问。为验证这一点,他们构建了 MemUse,一组取自真实部署中用户触发的记忆时刻,用具备整合意识的判断标准对自然对话响应打分,并在模型和上下文固定不变的条件下做对照。
📊 结果
同一套系统在 Direct QA 上得分 78.8%,但在自然对话中只主动提及了这些事实中的 7.9%——两者相差 71个百分点。在这些记忆时刻中,Natural Integration 与用户满意度显著相关,而 Direct QA 分数与满意度无关。作者公开了部署语料库、MemUse 数据集以及全部评判结果和打分提示词。
记忆评测长期对话用户满意度Benchmark人机交互