← 首页|学术|ArXiv 日报 — 2026-07-24
学术 · 2026年7月24日

ArXiv 日报

RL/训练 · Agent 架构 · 记忆 · Code Agent/SE · 具身导航 · Agent 安全
251
今日新增
16
精选
0
Duplex 相关
Zotero 近期新增集中于:Agent Training、GUI & Web Agents、Agentic RL、Agent Architecture  |  今日未发现明确的 duplex/turn-taking 论文(已做专项关键词扫描)。焦点集中在记忆系统的评测缺口(多跳关联、程序化记忆)、代码agent从"能不能改"转向"改得系统不系统"(性能优化/测试可靠性/修复验证),以及 agent 安全前置化——两篇论文都在强调风险常滞后于攻击行为本身。

目录

  1. 你的领域:RL/训练 · Agent 架构 · 评估框架
  2. GUI Agent / 记忆
  3. 代码 Agent / 软件工程
  4. 具身 / VLA
  5. AI 热点 / 趋势

你的领域:RL/训练 · Agent 架构 · 评估框架

2607.19592 · cs.AI
Knowledge-Centric Self-Improvement
打破"self-improvement必须优化agent本身"的默认假设,主张agent保持通用/可丢弃,持久化的对象是可复用的知识库。
这类"知识而非agent载体沉淀经验"的思路,呼应近期agent memory文献里"经验可迁移性"的关注点,对降低跨任务/跨agent设计的适配成本有直接参考价值。
agentic-rlself-improvementknowledge-base
2607.19962 · cs.CL/cs.AI
EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
针对大推理模型"过度思考"(冗余验证步骤)问题,现有fast-slow切换/轨迹压缩方法无法细粒度区分有益步骤和冗余步骤。
EvoThink用自剪枝训练(SPT)+"顿悟时刻"偏好优化同时提升推理效率和能力,是在token效率和推理能力之间找平衡的又一次尝试。
reasoning-efficiencyself-pruningpreference-optimization
2607.19555 · cs.MA/cs.AI
CHMAS: A Coupled Hierarchical Framework for Multi-Agent Reinforcement Learning
把MARL的全局协调与局部执行拆成战略层(每T步生成全局指导)和战术层(带邻域观测的分布式执行)两层耦合结构,双向信息流打通两层。
是分层MARL框架里少见地在"策略层更新频率"上做显式设计的工作。
marlhierarchical-rlmulti-agent
2607.19809 · cs.MA/cs.LG
Dreamer-CPC: Message Learning with World Models for Decentralized Multi-agent Reinforcement Learning
去中心化MARL通信的老问题——现有表示学习方法只能靠当前观测生成消息,无法传递历史累积信息。
Dreamer-CPC把collective predictive coding整合进DreamerV3的世界模型,让每个agent从世界模型的隐状态里提炼、交换携带历史信息的消息,是"世界模型+多agent通信"结合的一个具体落地。
marlworld-modelagent-communication

GUI Agent / 记忆

2607.19359 · cs.CL/cs.AI
Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles
现有长期记忆基准几乎只测单跳召回,多跳关联基本没被测过。提出MemHop(1000题、5跳深度、10个社交网络场景,逐跳证据标注)和ProGraph(子串匹配式profile扩展+压缩残差的两层记忆架构)。
填补了这个评测空白,也提醒我们"能召回"和"能多跳关联"是两件不同的事。
agent-memorybenchmarkmulti-hop-reasoning
2607.20064 · cs.AI
PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
长时程任务对LLM agent一直是老大难,在ARC-AGI-3这类持续学习基准上尤其明显。核心矛盾在于"该往context里存多少信息"的取舍——存得多则难以高效检索。
PRO-LONG用可执行的程序化记忆代替原始观测存储,是"记忆即代码"思路在长时程推理里的一次实践。
agent-memorylong-horizonprogrammatic-memory
2607.19830 · cs.AI/cs.IR
VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization
现有hypergraph RAG几乎都是纯文本范式,没有利用好现代多模态大模型的视觉感知能力。
VizRAG系统性地把视觉线索接入hypergraph感知的RAG流程,是"图结构RAG"和"多模态检索"两条线难得的交汇点。
ragmultimodalhypergraph

代码 Agent / 软件工程

2607.19966 · cs.SE/cs.AI
Towards Reliable C-to-Rust Translation with Rule-Guided Reasoning and Reinforcement Learning
遗留C代码向Rust迁移是提升内存安全同时降低人工重写成本的重要方向,但现有LLM方案在Rust特有规则识别和复杂语义捕捉上都有明显短板。
提出规则引导推理+RL的翻译框架,是"LLM代码迁移"这个实用场景里针对性较强的一次尝试。
code-agentcode-translationrust
2607.19653 · cs.SE/cs.AI
PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization
修复正确性的代码agent已经能打SWE-Bench,但repo级性能优化——既要保行为又要提速——仍是短板:现有agent常常错过抽象层/原生扩展背后的瓶颈,浅尝辄止就停手。
PerfAgent用profiler引导的迭代优化来解决这个问题,和昨天的PhoenixRepair一样,反映代码agent正从"能不能改"转向"改得够不够系统"这条主线。
code-agentperformance-optimizationprofiling
2607.19682 · cs.SE
Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation
来自工业部署的真实教训——LLM生成的单元测试在复杂框架/跨文件依赖的真实项目里经常编译失败或覆盖率不稳定。
CATGen没有指望LLM自己推断出完整项目上下文,而是把编译上下文显式工程化进流程,是难得的"从生产失败中反推方法论"的工业论文。
code-agentunit-testingindustrial-deployment
2607.19843 · cs.SE/cs.AI
Beyond Fail-to-Pass: Iterative Hardening of Co-Generated Bug Reproduction Tests and Fixes
指出自动程序修复里常用的bug复现测试(BRT)评价标准——fail-to-pass——本身就不够:有些通过F→P检验的BRT其实并不能真正帮助下游修复。
提出迭代加固BRT和修复补丁的共生成方案,是对"用什么信号驱动/验证自动修复"这个基础问题的一次纠偏。
code-agentbug-reproductionprogram-repair

具身 / VLA

2607.19695 · cs.RO
NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation
现实里配送/校园/应急场景经常需要agent在同一个episode里从室内走到室外,但现有基准几乎都把室内外导航分开评测,出口寻找、边界跨越等环节被系统性忽视。
NavVerse提供100室内+50室外+50室内外连续场景、1万episode的物理仿真基准,填上了这个"室内到室外无缝导航"的评测空白。
embodied-ainavigationbenchmark
2607.19880 · cs.RO
EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness
跨具身导航的核心矛盾——同一视觉观测对不同机器人本体可能意味着不同动作,纯视觉预测存在歧义。现有RL方案需要大规模交互和精细奖励设计,难以规模化预训练。
EA-Nav转向模仿学习+模块化多阶段设计,是"具身感知"这条线里对RL依赖症的一次替代方案。
embodied-aicross-embodimentimitation-learning
2607.19876 · cs.RO/cs.CV
KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding
评估具身世界模型的物理一致性是个公认难题——闭环仿真评测虽更可信,但几乎都依赖逆动力学模型(IDM)做动作提取,IDM本身在分布外数据上就不可靠。
这导致"世界模型不准"和"提取器出错"两种失效无法区分,KineBench提出免IDM的运动学grounding方法,把这两种误差来源解耦开。
embodied-aiworld-modelbenchmark

AI 热点 / 趋势

2607.19433 · cs.CR/cs.AI
The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI
从无状态生成模型到有状态自主agent的架构演进,带来了一类新的安全威胁——利用长期记忆做延迟攻击(内存注入攻击MINJA、睡眠agent),攻击向量和最终灾难性事件被时间维度解耦。
传统安全检测很难覆盖这种时间维度攻击,是agent记忆系统安全性讨论里少见的系统化威胁分类工作。
ai-safetyagent-memorysecurity-taxonomy
2607.19913 · cs.AI/cs.CR
JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
agent安全正从"内容审核"转向"在tool-using agent行动前预判风险"。JANUS训练guard模型从部分轨迹里预判延迟风险,用预判任务+裁决任务联合优化。
和Chronos Vulnerability一起构成今日"agent安全前置化"的暗线——都在强调风险往往滞后于攻击行为本身,必须提前布防。
ai-safetylong-horizonagent-monitoring
来源:arXiv cs.AI / cs.LG / cs.CL / cs.RO / cs.SE / cs.CR / cs.MA 新增列表(2026-07-24)+ Zotero 近期新增趋势分析