学术 · 2026年7月9日
ArXiv 日报
Agent 记忆 · RL训练 · 代码Agent · 安全
你的领域 7篇
代码Agent / SE 4篇
架构 / 基础设施 3篇
安全 2篇
今日亮点:Agent 记忆系统迎来集中突破——三篇论文分别从"记忆入环"(2607.05690)、"主动导航"(2607.05794)、"冲突保留"(2607.05844)三个维度重构多 agent 记忆架构;MCP 安全漏洞研究(2607.05744)揭示 Unicode TAG-block 攻击面,对 agent 工具生态影响深远。
你的领域
1 · cs.AI · 2607.05690
将记忆检索移入 agent 推理循环内部(每步读写),而非每轮仅查询一次外部存储。研究发现延迟是核心障碍,提出 in-process retrieval 机制显著提升多步任务中的信息利用率。与昨日 MOSS 的可审计记忆方向互补,从延迟角度解决 agent 工作记忆问题。
MemoryIn-ContextAgent-Architecture
2 · cs.AI · 2607.05794
NapMem 框架让 agent 把长期用户记忆视为可操作的结构化动作空间,而非被动消费预选证据。agent 学习何时读、写、更新记忆——个性化对话 agent 记忆系统的范式转变。
MemoryPersonalizationActive-Retrieval
3 · cs.AI · 2607.05844
多 agent 系统中分支、重试、副本之间产生冲突观察,现有实现用覆盖规则静默合并。StateFuse 提出基于标准 CRDT 的冲突保留内存契约,让冲突可检查、可修正——multi-agent 状态一致性的重要基础工作。
Multi-AgentMemoryState-Management
4 · cs.LG · 2607.05541
针对稀疏/延迟奖励场景,SRRL 让模型在回合结束后进行自我审查,并通过跨回合记忆和策略蒸馏将成功经验内化。在 agentic 环境中无需密集 reward signal 就能持续自我改进。
Agentic-RLSelf-ImprovementPolicy-Distillation
5 · cs.LG · 2607.05804
识别 on-policy distillation 在 long-horizon agent 任务中的两个低效:无信息步骤浪费计算、早期步骤教师监督质量差。TurnOPD 引入 turn-awareness 解决这两个问题,提升训练效率并改善最终策略质量。
Agentic-RLDistillationLong-Horizon
6 · cs.AI · 2607.05773
AgenticAI-Supervisor 提出 API 和 UI 驱动的 RL Gym 环境,将环境创建与可扩展执行解耦,以可验证执行替代启发式奖励。为 agentic RL 研究提供可复现的评估基础设施,解决当前 agentic RL benchmark 碎片化问题。
Agentic-RLEvaluationSimulation
7 · cs.AI · 2607.05775
系统梳理 LLM agent 在工具使用、多步规划、多 agent 协调、长期任务中的重复失败模式——这些问题在单篇评估论文中被遮盖,跨论文合成后规律清晰。为 agent 开发者提供当前能力边界的清醒认知。
EvaluationTool-UseFailure-Analysis
代码 Agent / 软件工程
8 · cs.SE · 2607.05810
代码生成的核心问题是程序看起来正确但违反规范语义。SCOPE 引入子目标批评机制,将自然语言规范分解为子目标并对每个子目标进行结构化反馈,比无结构反馈方法显著改善代码生成可靠性。
Code-GenerationSubgoalFeedback
9 · cs.SE · 2607.05772
在代码提交时检测漏洞诱发提交(VIC),需要跨异构信息源推理代码变更的语义影响。多阶段 LLM agent 将问题分解为差异分析、上下文理解、漏洞推断,在 VIC 检测上达到新 SOTA。
SecurityCode-AgentVulnerability
10 · cs.SE · 2607.05666
AI coding agent 是黑盒,但其 PR 变更是可观察的。本文构建 mutation pattern 经验分类法,发现 agent 的改进策略与人类遗传改进(genetic improvement)技术高度重叠——为理解 agent 代码搜索行为提供了底层视角。
Code-AgentEmpiricalMutation
11 · cs.SE · 2607.05677
研究 AI coding assistant(GitHub Copilot、Cursor 等)在开源项目中从代码建议演变为对话协作者的现状,量化 vibe-coding workflow 在 OSS 贡献中的实际影响——coding agent 在野外使用的首批系统性研究之一。
Code-AgentOpen-SourceEmpirical
Agent 架构 / 工具使用 / 基础设施
12 · cs.AI · 2607.05483
Agentic workflow 中多个 LLM 调用共享结构化状态,但每次调用只看到部分视图(progressive disclosure)。PatchOptic 提供投影视图 + 可验证结构化更新机制,确保局部操作不破坏全局状态一致性。
Agent-ArchitectureState-ManagementMulti-Agent
13 · cs.AI · 2607.05752
搜索增强并非总是有益:模型可能对已知答案多余搜索,或在应弃权时依赖嘈杂证据。用反事实监督训练搜索路由策略,在保持答案质量的同时大幅减少不必要检索——对 RAG 系统效率的重要优化。
RAGTool-UseSearch-Routing
14 · cs.LG · 2607.05708
Agent 系统在多轮交互、工具调用、跨 session 工作流中持续积累上下文,全量重放代价极高。Akashic 用 MemAttention 机制实现低开销的长上下文 agent 推理服务——agent 基础设施层的实用工程贡献。
InferenceInfrastructureKV-Cache
安全 / AI 热点
15 · cs.CR · 2607.05744
MCP 工具元数据在 one-time approval 后渲染,但攻击者可用 Unicode TAG-block 在视觉无害的描述中隐藏恶意 payload,在三个独立服务器实现上均验证了 approval-view 与执行时的保真度差距。对 MCP 生态安全的重要警示。
SecurityMCPPrompt-Injection
16 · cs.CR · 2607.05790
工具增强 LLM 倾向于过度调用工具。本文发现工具使用决策存在稳定的 heading 特定激活模式,通过 activation steering 精确控制工具调用频率——无需重新训练,可直接部署于已有模型。
Tool-UseInterpretabilityActivation-Steering
数据来源:arXiv cs.AI / cs.LG / cs.SE / cs.CR — 2026-07-09 · 精选 16 篇 / 291 篇