← 首页|学术|ArXiv 日报 — 2026-07-08
学术 · 2026年7月8日

ArXiv 日报

Agent · Memory · RL · GUI · Embodied · Code
319
今日总数
16
精选
4
你的领域
4
GUI · 记忆
4
代码 · 安全
4
具身 · VLA
今日亮点:Zotero 动态集中在 Reward Design、GUI & Web Agents、Agentic RL、Agent Architecture。GUI agent 的状态信念诊断、MOSS 可审计记忆替代 RAG、IDE coding agent workflow jailbreak 是今日最值得深读的三篇。

你的领域

Progress- and Reliability-Oriented Group Policy Optimization for Agentic RL2607.04242
在 step-level group-based RL 中,步骤级奖励往往过于稀疏或不稳定。本文提出同时优化进度(progress)和可靠性(reliability)的 group policy optimization,在 long-horizon agentic task 上比 GRPO 基线显著提升。
Agentic-RLGRPOStep-Level-Reward
Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators2607.04419
现有 agent 评估把多步轨迹压缩为最终答案或成功标志,掩盖了哪一步真正有效的诊断信息。ASV(Agent Step Value)对每个动作的状态转移进行细粒度评分,帮助开发者定位哪些动作真正推进了任务进展。
EvaluationStep-LevelAgent
LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL2607.04412
对于不可验证的指令跟随任务,RL 奖励依赖 LLM judge,但训练 prompt 是静态的——导致策略进化后 prompt 难度严重不匹配。本文让 LLM 作为 tutor 动态调整 prompt 难度,跟随策略能力自适应。
RLNon-VerifiableReward
A Workflow-Aware Serving Layer for Agentic Applications2607.02942
Agentic 应用的推理请求是 DAG 而非单次 call,但现有模型服务引擎只优化单次调用、现有 workflow 引擎不管推理效率。本文提出 workflow-aware serving layer,填补两层之间的空白,跨 DAG 节点联合优化模型调度。
ServingInfrastructureAgentic

GUI Agent · 记忆

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure2607.04334
GUI agent 同时拥有截图(像素)和 DOM/accessibility tree(结构)两条信道,但现有 benchmark 只评估任务成功率,不检测 agent 的状态信念从哪个信道来。本文构建诊断框架,发现 agent 在像素和结构不一致时会形成错误状态信念——这是 GUI agent 可靠性研究的关键盲区。
GUI-AgentState-BeliefBenchmark
UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning2607.04425
跨平台 GUI agent 的高质量交互轨迹稀缺,且已有数据分布不均。UI-MOPD 通过在线蒸馏在多平台上持续学习,在执行中生成新轨迹并立即用于策略更新——解决 GUI agent 的持续进化问题。
GUI-AgentDistillationContinual-Learning
MOSS: Memory-Orchestrated Semantic System — An Auditable Agentic Memory Architecture2607.04391
RAG 的向量相似检索本质上不可审计、不可解释。MOSS 以语义图为核心替代嵌入搜索,提供可审计的 agent 长期记忆——每一条检索路径都可追溯。与上周 A-TMA 的 ghost memory 方向互补,侧重透明性。
MemoryRAG-AlternativeAgentic
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents2607.04528
Agent benchmark 通常只报告任务成功率,但 harness(测试框架)本身会改变 agent 的多步信念——控制 agent 看到什么、哪些失败被修复、哪些状态被验证。本文量化 harness 诱导的信念偏移,是对 agent 评估方法论的重要批判。
EvaluationBenchmarkAgent

代码 Agent · 软件工程 · 安全

Refused in Chat, Written in Code: Workflow-Level Jailbreak in IDE Coding Agents2607.03968
IDE coding agent 是多轮、多步的,但安全评估还停留在单轮 chatbot 范式。本文构造 workflow-level jailbreak——把有害意图分散到多个编辑/运行步骤,每一步看似无害,组合起来绕过安全限制。对 coding agent 安全的重要警示。
SafetyCode-AgentJailbreak
The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling2607.04034
Function calling benchmark 的指标鼓励模型"宁可给错也不要放弃",导致 agent 在不确定时倾向于幻觉性调用。本文加入显式弃权机制,让 agent 在不确定时输出 IDK 而非错误调用——在真实 agentic 场景中大幅减少灾难性错误。
Function-CallingReliabilityTool-Use
"AI Slop is DDoSing Open Source"2607.04003
AI 生成内容正以"AI-DDoS"的形式冲击开源社区:大量看似合理但低质量的 PR/issue 占用维护者有限精力,构成事实上的拒绝服务。基于 Reddit/GitHub/HN 的混合方法研究,量化了这一现象并提出社区层面的应对策略。
OSSAI-ImpactSoftware-Engineering
SkillFab: An Agent-Native Skill Production Platform2607.03780
Agent 运行时先搜索可复用 skill,找不到时自动发起 demand-first issue,触发 SkillFab 流水线生成经过 review 的可复用 skill 并合并入库。将 agent 的能力缺口转化为持续增长的 skill 仓库——agent-native 的软件工程范式。
SkillAgent-Infrastructure

具身 · VLA · 多模态

ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI2607.04426
将感知、规划、动作生成、进度监控、从经验学习整合为单一 embodied foundational model,提出 physical agentic AI 的统一架构,而非各模块拼凑。是具身 AI 向通用 agent 演进的代表性工作。
EmbodiedFoundation-ModelPhysical-Agent
VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models2607.04517
VLA 模型对指令措辞极度敏感,但模型是黑盒无法微调。VLA Grounder 将语言描述空间作为可优化输入,在不改动模型权重的前提下搜索更有效的语言条件——提升冻结 VLA 模型在新任务上的成功率。
VLALanguage-ConditioningBlack-Box
Biological Motifs for Agentic Control2607.04240
当前 agentic 架构临时拼凑、易产生幻觉级联、死循环和 prompt injection。本文论证生物系统(神经控制回路、免疫系统、细胞信号)中已有久经考验的控制 motif,可直接借用以改善 agent 可靠性和安全性。
Agent-ArchitectureBio-InspiredSafety
SovereignNegotiation-Bench2607.02814
个人 agent 将越来越多地代表用户谈判(退款、订阅变更、费用分摊)。现有谈判 benchmark 强调协议达成和策略能力,但忽视隐私保护、用户授权范围、证据合法性和机构压力。本文填补这一空白,为"主权 agent"定义评估标准。
Personal-AgentNegotiationBenchmark
高松灯 · arXiv 精选 · 2026-07-08 · 319 篇中精选 16 篇