← 首页|学术|ArXiv 日报 — 2026-07-16
学术 · 2026年7月16日

ArXiv 日报

Agent 架构 · 推理基础设施 · 记忆系统 · VLA · 可解释性
275
今日总数
15
精选
4
你的领域
3
记忆/OS
3
代码/GUI
3
具身/VLA
2
热点
今日亮点:Agent benchmark 的信息效率差异极大(AppWorld 15% 任务够用 vs SWE-bench Verified 需 90%);token 减少 ≠ 成本降低(prompt cache 占账单 80%);Prospective Memory 首个 benchmark(最强 GPT-5.4 agent 仅 65.1% F1);VistaVLA 用 3DGS 构建空间语义认知地图 +22.8% 真实任务;skill 幻觉名平均 36%、可被供应链攻击利用。

目录

  1. 你的领域(推理 / 架构 / 训练 / 评估)
  2. 记忆 / Agent OS
  3. 代码 Agent / GUI Agent
  4. 具身 / VLA
  5. AI 热点 / 趋势

🎯 你的领域(推理 / 架构 / 训练 / 评估)

2607.12267 · cs.LG cs.AI
Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents
SLEUTH 把 agent 推理状态显式化为三类:Confirmed Facts(有来源)、Active Hypotheses(按证据排序)、Open Questions(驱动下一步行动)。HotpotQA +5 分,4-hop 链 +11 分;同样的"commitment trigger"在无结构 agent 上完全失效,在 SLEUTH 上有效——说明组织化的认知状态本身是关键,不是模型能力。弱模型上强制执行协议恢复最难问题上高达 +19 分。对 duplex/long-horizon agent 的状态管理问题有直接对应。
agent-architecturemulti-hopworking-memoryepistemic-state
2607.12161 · cs.CL
Token Reduction Is Not Cost Reduction
2908 次 Claude Code 真实付费运行的实证:prompt cache 占账单约 80%,tool output 压缩 38% 的 arm 实际成本反而高了 6.8%(95% CI 不含零)。压缩还会破坏"逐字编辑锚点",SWE-bench Go 任务 patch 应用率从 27/40 降到 15/40,且以更高成本产出更少解答。正确评估指标应是"success-adjusted billed cost"而非 token 减少量。对任何做 agent 上下文压缩优化的人都是重要的实证警告。
inference-infrastructureagent-costevaluationcache
2607.12236 · cs.LG cs.CL
Speculate with Memory: Lossless Acceleration for LLM Agents
在环境 idle 时用小模型预测 agent 下一步(speculative execution),新增三类在线记忆:转移统计表、情节记忆(相似轨迹片段检索)、confusion tracker(抑制重复错误)。action prediction 准确率 +19–39%,observation prediction 最高 2.5×,且随记忆积累持续增长,跨 speculator 模型泛化。全部在 idle 时间完成,不增加墙钟延迟,actor 轨迹与非推测执行完全一致(lossless)。
inference-infrastructurespeculative-executionagent-memoryacceleration
2607.12338 · cs.AI
How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks
在 SWE-bench、AppWorld、tau-bench 完整 task-level 记录上做 replay 分析:在严格 0 pp 阈值下,AppWorld 只需 15% 任务即可复现完整 benchmark 的配对结论,tau-bench 需 25%,SWE-bench Verified 需 90%,SWE-bench Lite 在 95% 下仍达不到。不同 benchmark 的信息密度差异极大。部分评估报告必须说明:容错范围、任务选取策略、覆盖规则、决策规则、允许多少比较未解决。
evaluationbenchmarkingagentpartial-evaluation

🧠 记忆 / Agent OS

2607.12385 · cs.AI
PM-Bench: Evaluating Prospective Memory in LLM Agents
首个 LLM Agent 前瞻性记忆(prospective memory)benchmark:在其他任务进行时,在特定未来时机执行意图。灵感来自认知科学 Virtual Week 范式,模拟七天内 agent 在继续主任务的同时判断是否有延迟任务到期。测试 8 种 SOTA LLM × 8 种 agent 配置;最强方法(GPT-5.4 agent)F1 仅 65.1%,且无单一策略在所有模型上占优。对长期可靠 agent 设计是必须面对的挑战。
memoryevaluationagent-reliabilityprospective-memory
2607.10350 · cs.AI cs.RO
ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
在低层控制器之上增加 deliberative agent 层:场景感知规划、技能执行、多阶段验证、多模态记忆、边云协同。核心是 Universal Multi-modal Graph Memory,把对话、视觉观察、空间上下文、时序关系和任务轨迹转化为图节点/边。失败驱动自进化循环将诊断出的记忆失败转为 evo-asset(防当前 split 数据泄露)。LoCoMo 88.7,OpenEQA 60.4,Mem-Gallery 89.0。同时发布 EmbodiedWorldBench(200+ 任务,16 个室内外场景)。
embodiedmemoryagent-osmulti-modal-graph
2607.12204 · cs.LG
Forgetful Attention: A Trainable Support-Vector Memory with Certified Selection and Exact Unlearning
用 one-class SVM 替代 softmax attention:支持向量系数决定哪些 token 被保留,其余 token 精确证明对输出无影响(certified eviction);可逆增量求解器支持精确遗忘(删一个 token 等价于从头重训,偏差中位数 10⁻⁹)。enwik8 BPC 2.178 vs 2.383(8.6% 改进,p=0.001),rare-item recall 0.86 vs 0.32。主要价值在需要合规审计(GDPR、医疗记录删除)的 agent 记忆场景。
memoryattention-mechanismexact-unlearninginterpretability

💻 代码 Agent / GUI Agent

2607.12340 · cs.SE cs.CR
Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents
LLM agent 推荐第三方 skill 时平均 36% 会给出不存在的名字(幻觉 skill 名)。攻击路径:预先注册这些假名下的恶意 skill,等待受害者安装(supply-chain 攻击,攻击者成本极低)。15000 条 prompt、12 种配置(4 standalone LLM + 8 agent),共生成 5669 个虚假 skill 名,且不同模型反复出现相同假名(高可预测性)。最强防御(retrieval grounding)把幻觉率从 40.8% 降到 3.2%,但正确推荐率仅约 1/6——安全和可用性之间存在严重冲突。需要 registry 级别的结构性修复。
code-agentsecurityhallucinationsupply-chain
2607.12058 · cs.SE cs.AI cs.CR
AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration
给定漏洞修复 commit,自动定位触发语句(trigger localization)——比二值漏洞检测更难,真实 CVE 中 trigger 常在 patch 函数外多层调用处。AutoTrace 用 LLM agent 逐层探索代码属性图(CPG),每个报告的 trigger 必须有来自图的显式证据支撑(deterministic admissibility gates)。InterPVD 上 75.0% VulnHit,优于 SOTA。同时构建 SinkTrace-Bench(1542 对 verified source-to-sink 因果链),frontier LLM 在上面表现很差——暴露因果推理缺口。
code-agentsecurityvulnerabilityinterprocedural
2607.12056 · cs.AI cs.HC
Designing Agent-Ready Websites for AI Web Agents: A Framework for Machine Readability, Actionability, and Decision Reliability
从网站设计者视角看 Web Agent 问题:定义"agent-ready website"三维框架(agent 可解释性、可执行性、决策可靠性)。控制实验:相同 catalog 的普通 vs agent-ready 版本,三种 browser agent(GPT-4.1, Gemini-2.5 Flash, Grok-4 Fast)共 300 次运行,严格成功率 89.3% vs 49.3%,步数从 9.31 降到 6.49,PARTIAL 从 43 降到 3。"为 agent 设计基础设施"而非"让 agent 适应人类网站"——这个视角在 Web agent 部署中被严重低估。
web-agentgui-agentagent-infrastructuredesign-framework

🤖 具身 / VLA

2607.12356 · cs.RO
VistaVLA: Geometry- and Semantic-Aware 3D Gaussian-Grounded VLA for Robotic Manipulation
VLA 的核心缺陷:缺乏显式 3D 场景表示,现有方案提供的深度图/点云只有低级结构,缺乏高级语义。VistaVLA 用多视角 VLM 特征提升到 3D Gaussian primitives,形成几何锚定的语义 token;再通过 Merge-then-Query(MtQ)压缩密集 Gaussian token(99% token 压缩率),保留动作相关的空间布局。真实场景 7 个任务 +22.8%,OOD 任务 +30%(vs VLA-Adapter)。将人类"空间语义认知地图"思路用 3DGS 参数化——几何感知 + 语义感知的联合表示是方向。
vlaembodied3d-gaussianmanipulation
2607.12287 · cs.RO
Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference
VLA 推理延迟的两个主要来源:连续帧重复视觉编码 + 扩散 policy 多步采样。系统级方案:只对动态区域做增量 token 更新(非重编码全帧)+ 压缩扩散采样为 2 步(efficiency-oriented training)。Libero、RobotWin 及真实机器人上超过 2× 加速,成功率最高 98%。和 VistaVLA 构成互补:VistaVLA 提升质量(3D 表示),此文提升速度(时序冗余消除)。
vlainference-efficiencydiffusion-policyincremental-encoding
2607.12114 · cs.RO cs.AI cs.CV
GaitSpan: Growing Humanoid Locomotion from Walking to Running
把走路当"种子技能"扩展到慢跑和跑步——三机制:节律生成(调制冻结走路 policy 的多个内部时钟)、步幅塑形(SLIP 模型启发的物理奖励,奖励动态步态)、残差适应(修正节律+步幅未覆盖的细节)。首个覆盖全步速范围的单一指令条件化人形 policy,零样本迁移到新环境和形态。比多专家/人体动作模仿方法收敛更快。"从已有技能生长,而非从头训练"是 skill composition 的具身版本。
embodiedhumanoidlocomotionskill-composition
2607.12279 · cs.CL cs.LG
A Shared Subcircuit Lets LLMs Count Down Across Tasks
在 Llama-3.1-70B 中定位了通用"倒计时子电路"(追踪剩余 token 数到目标长度)。核心发现:该子电路使用的表示 motif 与 frontier LLM(不同模型)在独立任务上发现的相同 motif 一致——暗示计数机制是跨模型收敛的通用结构(convergent circuits)。无监督探测还在多种自然语言任务中发现该电路激活,包括从上下文推断目标长度的任务。与 length penalty / token budget 机制的关系值得深思。
mechanistic-interpretabilitycircuitslength-controlconvergent-evolution
2607.11945 · cs.CL cs.LG
Belief-Reality Separation Lives in Routing over a Shared Value Slot in Language Models
LM 的信念-现实分离("Anna 认为杯子是蓝色;实际是红色")依赖两个分离机制:通用 value slot(存储属性值,无"是信念还是现实"标签)+ router(在信念 vs 现实帧间切换)。干预 slot 会同时影响两类读出;分离在于解耦的路由子空间。该行为在 3B–7B 参数间涌现,横跨三种架构。同伴论文将扩展到反事实、虚构、时间语境。这个"slot-and-router"格式是否是 LM 处理非实际语境的通用机制?
mechanistic-interpretabilitytheory-of-mindbelief-staterouting
数据来源:arXiv cs.AI / cs.LG / cs.RO / cs.SE / cs.CL · 2026-07-16 · 今日总量 275 篇 · Zotero 近期新增集中于 GUI & Web Agents、Agent Training、Reward Design、Agentic RL