← 首页|学术|MemArena:端侧个人记忆助手的第一人称大规模评测基准
cs.CL · cs.AI · 2608.02613 · 提交于 2026年5月20日

MemArena:端侧个人记忆助手的第一人称大规模评测基准
MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale

Jiadong Zhang, Xiaosong Ma — MBZUAI(穆罕默德·本·扎耶德人工智能大学)
💬 面向端侧个人记忆助手的benchmark:用50个agent模拟15天、1030万+token的活动密集对话世界。核心发现——记忆后端的选择比阅读器模型规模化更能决定内容准确率;而"权限感知访问"这一维度在所有后端上都失败,Oracle检索过度泄露,其余后端又过度保守,"既能检索又能把关"的组合几乎不存在。

🎯 问题

现有记忆基准的三个缺口
端侧个人记忆助手需要在设备本地用开放权重模型处理私密的人际对话,但作者认为现有记忆基准测试普遍未能同时覆盖三个特性:活动密集型交互(活动频率高、信息量大的连续对话流)、第一人称视角(agent只能看到自己参与的观察,而非上帝视角的全局对话记录)、以及连贯的多会话世界(跨越多天、多轮会话且彼此关联的统一叙事)。缺少这三者的组合,评测就无法反映端侧记忆助手在真实生活场景中面对的压力——既要从海量嘈杂交互里捞出关键事实,又要在权限边界不清晰的人际关系网络中判断"这句话该不该对谁说"。

🔬 方法

MASim 多智能体模拟器 + 六维评测体系
作者构建了 MASim 模拟器,驱动 50 个智能体在 15 天内持续互动,生成一个单一、连贯的对话世界,累计 1030 万对话文本 token,每个智能体每天还额外产生 24,100 个纯文本的第一人称观察 token(即只记录该智能体亲历的视角内容,而非全局记录)。基于这些交互历史,标准答案围绕六个维度自动生成:
评测覆盖五种开源"阅读器"模型(Qwen3-0.6B、Qwen3-8B、Qwen3-32B-AWQ、Llama-3.2-3B、Mistral-7B-Instruct-v0.3)分别搭配五种记忆后端:Vanilla(无检索的原始上下文)、BM25-RAG、Oracle检索(提供标注证据会话的诊断性上限)、Memobase(开源用户画像式长期记忆系统)、MemSearch(markdown + Milvus-Lite混合索引的原始会话片段检索)。MemOS、Mem0、Graphiti 因对阅读器输出有严格JSON格式要求、端侧小模型经常无法满足而被排除。评分按输出类型而非维度进行:完形填空用精确匹配准确率,其余问答类用LLM评判(GPT-4o-mini)做二元正确性判定,虚构前提弃权用确定性拒绝检测器,权限感知访问用五标签体系(正确披露/错误披露/不知道/拒绝/其他)转换为对DENY/ALLOW情形的二元判断。评判可靠性通过三位独立标注者对500个分层样本标注验证,与LLM评判者一致率96.7%(Cohen's κ=0.93,权限维度94.1%/κ=0.90)。

📊 结果

记忆后端选择 > 模型规模扩展
在 Qwen3-0.6B 上,把后端从 Memobase 换成 MemSearch 带来 +32.5 / +19.2 个百分点的提升,超过了固定使用 MemSearch 后端、单纯扩大阅读器模型规模所带来的 +10.6 / +6.8 个百分点提升。这说明对端侧小模型而言,检索基础设施的设计比"换个更大的模型"更能决定内容准确率的上限。
权限感知访问全面失败
所有可部署后端在权限感知访问维度的 F1_PU 分数均未超过44分。用 Oracle 提示(诊断上限)时,模型在有权限披露的情况下大约只能答对一半案例,但在不该披露时反而更容易泄露——即 Oracle 的问题是"过度泄露"。而 MemSearch、BM25-RAG 等真实可部署的后端则表现出相反的倾向:"在大多数情况下拒绝回答",反映出它们难以捕捉跨会话上下文或身份/元数据线索,因而无法自信地做出权限判断。论文用一个具体场景说明这一挑战:Bob 向 Charlie 的智能体询问"Alice关于就诊的说法",智能体不仅要检索到信息,还必须判断这条信息是否适合向 Bob 透露。作者将这种全局现象概括为"要么检索失败,要么泄露"——检索能力与权限把关能力兼备的组合在实验中几乎不存在。
延迟仅在极小模型上成为瓶颈
在 NVIDIA Spark GB10 边缘节点、SGLang 框架、并发数为1的条件下,记忆搜索仅带来固定的额外延迟:BM25-RAG约87ms、Memobase约7ms、MemSearch约48ms。对多数阅读器-后端组合而言,这只占首字生成时间(TTFT)的一小部分,只有在阅读器模型极小(如0.6B级别)时,检索延迟才会在总延迟中占据明显比例。

💡 我的看法

这篇论文最有价值的地方不是"又一个记忆benchmark",而是首次把权限感知记忆检索作为一个独立、可量化失败的评测维度提出来——而且结果是全线失败,Oracle过度泄露、部署级后端过度保守拒答,没有一个后端能同时做到"检索到位"和"边界清晰"。这与你关注的 duplex agent / 实时交互场景高度相关:全双工agent在多方对话中同样需要实时判断"这句刚检索到的记忆该不该在当前turn说出来",而这篇论文说明当前的记忆架构(无论是画像式的Memobase还是检索式的MemSearch)都还没有为这种细粒度、身份敏感的访问控制做好准备。另外,"记忆后端选择比模型规模化更影响准确率"这一发现也提示:如果未来要为duplex agent设计端侧记忆模块,检索/后端架构的投入优先级应该高于死磕更大的阅读器模型。权限感知访问,目前看是agent记忆研究里一个被低估但确实存在、且可复现的系统性盲区,值得持续关注是否有后续工作专门攻克。
Agent MemoryBenchmarkOn-DeviceAccess Control
来源: arXiv:2608.02613