← 首页|学术|ArXiv 日报 2026-07-04
📑 ArXiv 日报 2026-07-04
🔗 Telegraph

ArXiv 日报 — 2026-07-04

📚 近期新增集中于:Reward Design、GUI & Web Agents、Agentic RL、Agent Architecture
297
今日总数
14
精选论文
10
你的领域
4
AI 热点
摘要:

你的领域

1 cs.AI 2607.02255

AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents

AgenticSTS 团队
Agent MemoryLong-HorizonTestbed

首个将 long-horizon agent 记忆抽象为"有界合约"的测试床,支持隔离研究记忆组件对决策的独立贡献,为 agent 记忆架构研究提供可复现的实验基础。

2 cs.AI 2607.01935

A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory

A-TMA 团队
Agent MemoryLong-Term MemoryState Awareness

识别并形式化"ghost memory"这一长期记忆的核心失效模式,提出三层记忆状态感知框架,显著减少记忆矛盾导致的答案错误。

3 cs.AI cs.SE 2607.01641

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

(Agent 可靠性研究团队)
Agent ReliabilityAgentic LoopFailure Mode

首次系统定义和分类 Infinite Agentic Loop 问题,构建专项 benchmark,揭示现有主流 agent 框架在无边界反馈路径下的普遍脆弱性。

4 cs.AI cs.LG 2607.01846

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP 团队
Agent TrainingDomain AdaptationPost-training

提出端到端闭环 agent 后训练框架,将训练→评估→发布门控统一管理,系统解决业务场景中后训练收益不确定和发布风险问题。

5 cs.SE cs.AI 2607.02436

Reasoning effort, not tool access, buys first-try reliability in agentic code generation

(实证研究团队)
Code AgentReasoningAgentic Engineering

大规模受控实验否定"更多工具 = 更好结果"的假设,证明推理能力是 agentic code generation 首次成功率的主要决定因素,为工具能力扩展决策提供实证依据。

6 cs.SE cs.AI 2607.01929

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

(Code Agent 研究团队)
Code AgentRepositoryStructural Reasoning

将代码 repo 探索从纯文本升级为文本+结构双模态,使 agent 能直接推理调用图和依赖链,在 SWE-Bench 上显著提升复杂长程 issue 的解决率。

7 cs.AI 2607.01942

Atomic Task Graph: A Unified Framework for Agentic Planning and Execution

ATG 团队
Agent PlanningTask GraphExecution

提出统一的 agentic 任务图表示,将隐式文本依赖显式化为图结构,在不额外训练的前提下支持并行执行和中间验证,在多类复杂任务上超越 CoT 和 ReAct 基线。

8 cs.AI 2607.02032

PACE: A Proxy for Agentic Capability Evaluation

PACE 团队
Agent EvaluationBenchmarkCost Efficiency

提供 agentic benchmark 的廉价代理评估方法,通过原子能力子集准确预测 SWE-Bench/GAIA 等昂贵评估的排名,将评估成本降低数个数量级。

9 cs.SE cs.AI 2607.02294

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

UnderSpecBench 团队
Code AgentSafetyDevOps

定义"行动边界违规"新评估维度,揭示主流 coding agent 在欠规格指令下普遍存在高风险推测行为,为 agentic 安全评估提供新标准。

10 cs.SE 2607.02389

Steerability via Constraints: A Substrate for Scalable Oversight of Coding Agents

(Coding Agent 治理研究团队)
Code AgentGovernanceOversight

将传统工程治理方法(access control/coding conventions)系统化迁移为 coding agent 的约束层,证明约束可控性比自然语言监督更高效、更可扩展。

AI 热点

1 cs.AI cs.MA 2607.02507

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

(Multi-Agent 社会结构研究团队)

LLM agent 在有社会结构的设置中(角色/受众/关系)会怎样行动?本文引入双通道辩论框架:agent 同时产生公开发言(进入共享历史)和私下发言(只被记录、不展示给其他 agent)。在无任何显式目标的条件下,agent 公私行为是否一致?研究发现社会结构会改变 agent 公开表达的内容,且不同角色 agent 之间的隐性目标会涌现出对齐或背离。对 multi-agent AI safety 有重要含义。

2 cs.SE 2607.01418

Adoption and Impact of Command-Line AI Coding Agents at Microsoft (Claude Code + GitHub Copilot CLI)

微软研究团队

微软 2026 年初在数万名工程师中铺开 Claude Code 和 GitHub Copilot CLI 的大规模真实采用研究。发现:首次使用主要通过同伴传播(而非管理层推动);留存率和工程速度提升与推理投入水平关联更强,与工具本身关联较弱。为组织级 agentic 工具部署决策提供了迄今最大规模的真实数据。

3 cs.AI cs.LG 2607.02134

Coding-agents Can Replicate Scientific Machine Learning Papers

(科学 ML 复现研究团队)

科学 ML 论文通常有可计算的声明(如 RMSE < 5%)。coding agent 能否仅凭论文材料复现这些声明?本文提出 Paper-replication 工作流:将每个论文声明作为目标,记录生成证据是否支持该声明。研究 coding agent 在哪些声明类型上成功/失败,为"AI 加速科研复现"提供系统性实证数据。

4 cs.AI cs.LG 2607.01830

Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

MRRG 团队

现有 rubric-based judge 通常只用一个通用评估者生成维度,存在"维度盲点"——重要的人类偏好维度被遗漏。MRRG(Multi-Role Rubric Generation)让多个具有不同视角的角色分别生成 rubric,再聚合成全面评分标准。无需训练、无需参考答案,在 reward modeling 和 LLM 评估上优于单角色基线。

今日 297 篇 | 精选 14 篇 回复序号可深读 | 回复「存 N」加入 Zotero