← 首页|学术|ArXiv 日报 — 2026年7月9日
学术 · 2026年7月9日

ArXiv 日报

Agent 记忆 · RL训练 · 代码Agent · 安全
你的领域 7篇 代码Agent / SE 4篇 架构 / 基础设施 3篇 安全 2篇
291
今日总数
16
精选
7
你的领域
4
代码Agent
3
架构/基础
2
安全
今日亮点:Agent 记忆系统迎来集中突破——三篇论文分别从"记忆入环"(2607.05690)、"主动导航"(2607.05794)、"冲突保留"(2607.05844)三个维度重构多 agent 记忆架构;MCP 安全漏洞研究(2607.05744)揭示 Unicode TAG-block 攻击面,对 agent 工具生态影响深远。
  1. 你的领域:RL/训练 · Agent 架构 · 评估
  2. 代码 Agent / 软件工程
  3. Agent 架构 / 工具使用 / 基础设施
  4. 安全 / AI 热点

你的领域

1 · cs.AI · 2607.05690
Memory in the Loop: In-Process Retrieval as Extended Working Memory for Language Agents
将记忆检索移入 agent 推理循环内部(每步读写),而非每轮仅查询一次外部存储。研究发现延迟是核心障碍,提出 in-process retrieval 机制显著提升多步任务中的信息利用率。与昨日 MOSS 的可审计记忆方向互补,从延迟角度解决 agent 工作记忆问题。
MemoryIn-ContextAgent-Architecture
2 · cs.AI · 2607.05794
From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space
NapMem 框架让 agent 把长期用户记忆视为可操作的结构化动作空间,而非被动消费预选证据。agent 学习何时读、写、更新记忆——个性化对话 agent 记忆系统的范式转变。
MemoryPersonalizationActive-Retrieval
3 · cs.AI · 2607.05844
StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems
多 agent 系统中分支、重试、副本之间产生冲突观察,现有实现用覆盖规则静默合并。StateFuse 提出基于标准 CRDT 的冲突保留内存契约,让冲突可检查、可修正——multi-agent 状态一致性的重要基础工作。
Multi-AgentMemoryState-Management
4 · cs.LG · 2607.05541
Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation
针对稀疏/延迟奖励场景,SRRL 让模型在回合结束后进行自我审查,并通过跨回合记忆和策略蒸馏将成功经验内化。在 agentic 环境中无需密集 reward signal 就能持续自我改进。
Agentic-RLSelf-ImprovementPolicy-Distillation
5 · cs.LG · 2607.05804
TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
识别 on-policy distillation 在 long-horizon agent 任务中的两个低效:无信息步骤浪费计算、早期步骤教师监督质量差。TurnOPD 引入 turn-awareness 解决这两个问题,提升训练效率并改善最终策略质量。
Agentic-RLDistillationLong-Horizon
6 · cs.AI · 2607.05773
Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
AgenticAI-Supervisor 提出 API 和 UI 驱动的 RL Gym 环境,将环境创建与可扩展执行解耦,以可验证执行替代启发式奖励。为 agentic RL 研究提供可复现的评估基础设施,解决当前 agentic RL benchmark 碎片化问题。
Agentic-RLEvaluationSimulation
7 · cs.AI · 2607.05775
Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
系统梳理 LLM agent 在工具使用、多步规划、多 agent 协调、长期任务中的重复失败模式——这些问题在单篇评估论文中被遮盖,跨论文合成后规律清晰。为 agent 开发者提供当前能力边界的清醒认知。
EvaluationTool-UseFailure-Analysis

代码 Agent / 软件工程

8 · cs.SE · 2607.05810
SCOPE: Leveraging Subgoal Critiques for Code Generation
代码生成的核心问题是程序看起来正确但违反规范语义。SCOPE 引入子目标批评机制,将自然语言规范分解为子目标并对每个子目标进行结构化反馈,比无结构反馈方法显著改善代码生成可靠性。
Code-GenerationSubgoalFeedback
9 · cs.SE · 2607.05772
Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents
在代码提交时检测漏洞诱发提交(VIC),需要跨异构信息源推理代码变更的语义影响。多阶段 LLM agent 将问题分解为差异分析、上下文理解、漏洞推断,在 VIC 检测上达到新 SOTA。
SecurityCode-AgentVulnerability
10 · cs.SE · 2607.05666
What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests
AI coding agent 是黑盒,但其 PR 变更是可观察的。本文构建 mutation pattern 经验分类法,发现 agent 的改进策略与人类遗传改进(genetic improvement)技术高度重叠——为理解 agent 代码搜索行为提供了底层视角。
Code-AgentEmpiricalMutation
11 · cs.SE · 2607.05677
From Conversation to Contribution: Characterizing Coding Agent in Open-Source Software
研究 AI coding assistant(GitHub Copilot、Cursor 等)在开源项目中从代码建议演变为对话协作者的现状,量化 vibe-coding workflow 在 OSS 贡献中的实际影响——coding agent 在野外使用的首批系统性研究之一。
Code-AgentOpen-SourceEmpirical

Agent 架构 / 工具使用 / 基础设施

12 · cs.AI · 2607.05483
PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates
Agentic workflow 中多个 LLM 调用共享结构化状态,但每次调用只看到部分视图(progressive disclosure)。PatchOptic 提供投影视图 + 可验证结构化更新机制,确保局部操作不破坏全局状态一致性。
Agent-ArchitectureState-ManagementMulti-Agent
13 · cs.AI · 2607.05752
When Should LLMs Search? Counterfactual Supervision for Search Routing
搜索增强并非总是有益:模型可能对已知答案多余搜索,或在应弃权时依赖嘈杂证据。用反事实监督训练搜索路由策略,在保持答案质量的同时大幅减少不必要检索——对 RAG 系统效率的重要优化。
RAGTool-UseSearch-Routing
14 · cs.LG · 2607.05708
Akashic: A Low-Overhead LLM Inference Service with MemAttention
Agent 系统在多轮交互、工具调用、跨 session 工作流中持续积累上下文,全量重放代价极高。Akashic 用 MemAttention 机制实现低开销的长上下文 agent 推理服务——agent 基础设施层的实用工程贡献。
InferenceInfrastructureKV-Cache

安全 / AI 热点

15 · cs.CR · 2607.05744
Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol
MCP 工具元数据在 one-time approval 后渲染,但攻击者可用 Unicode TAG-block 在视觉无害的描述中隐藏恶意 payload,在三个独立服务器实现上均验证了 approval-view 与执行时的保真度差距。对 MCP 生态安全的重要警示。
SecurityMCPPrompt-Injection
16 · cs.CR · 2607.05790
Controlling Tool Use with Heading-Specific Activation Steering
工具增强 LLM 倾向于过度调用工具。本文发现工具使用决策存在稳定的 heading 特定激活模式,通过 activation steering 精确控制工具调用频率——无需重新训练,可直接部署于已有模型。
Tool-UseInterpretabilityActivation-Steering
数据来源:arXiv cs.AI / cs.LG / cs.SE / cs.CR — 2026-07-09 · 精选 16 篇 / 291 篇