← 首页|学术|ArXiv 日报 — 2026-07-18
学术 · 2026年7月18日

ArXiv 日报

Agent 架构 · Agent Training/对齐 · Agent 记忆/Code Agent · 具身 VLA
本期脚本仅部分抓取成功(294 条候选中前约 100 条有标题,其余为空),从已成功抓取的候选中筛选并与 7/17 已发布篇目去重。
294
今日新增
15
精选
4
具身/VLA
Zotero 近期新增集中于:GUI & Web Agents、Agent Training、Agentic RL、Reward Design

目录

  1. Agent 架构 / 安全与基础设施
  2. Agent Training / 对齐
  3. Agent 记忆 / Code Agent / SE
  4. 具身 / VLA

Agent 架构 / 安全与基础设施

2607.14166 · cs.SE/cs.CR/cs.DC
Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
测量并修复主流 agent 框架"暂停/取消/超时"控制原语的执行缺口。6个框架全部存在"sibling leak"漏洞——一个分支暂停时兄弟分支仍执行副作用,导致 approval reject 无法真正阻止已发生的操作。
提出 SOUNDGATE 环境外部效果门作为通用修复方案,形式化验证(TLA+/TLAPS)+ 大规模差分测试双重背书,1200万次操作零漏检。
agent-safetycontrol-primitivesformal-verification
2607.14275 · cs.AI/cs.MA
AI Agents Do Not Fail Alone: The Context Fails First
系统性验证"上下文质量是 agent 可靠性的独立先行指标":用多陪审员共识打分从角色清晰度、防护覆盖、指令一致性、工具schema质量、grounding充分性、注入抗性、token效率七个维度评估上下文。
各维度与对应行为失败高度相关(grounding预测幻觉抗性、guardrail覆盖预测操纵抗性),把上下文工程变成可审计的评估层。
context-engineeringagent-reliabilityevaluation
2607.14336 · cs.SE/cs.AI
Copy-on-Write Scoring: Application-Specific Agent Evaluations
用 PostgreSQL 级 Copy-on-Write 隔离 agent 的数据库写操作,在真实应用环境(而非复制沙盒)里做会话级和操作级评分,定位 agent 在具体工具面上的成功/失败点。
在开源项目管理平台 Plane 上验证,评分结果直接驱动了实际工具面修复并带来可量化的模型表现提升。
agent-evaluationtool-surfacedatabase
2607.14431 · cs.CL/cs.AI/cs.LG/cs.PF
Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
把"验证过的知识"存成 byte-exact KV 状态,移植进新推理上下文时逻辑输出与从头计算逐字节一致(SHA-256相等,零KL散度)。
冻结的 Gemma-4-12B 在 AIME2025 上从 80% 提升到 93.3%;8个此前无法在预算内解出的题目仅用61个解码token从缓存直接给出答案,节省约6574倍token。
kv-cacheverified-knowledgeinference-efficiency

Agent Training / 对齐

2607.14552 · cs.CL/cs.AI
Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
揭示一个correctness filtering发现不了的训练数据污染:当采样失败后"展示答案让模型倒推链条"生成的CoT会系统性降低可验证推理准确率。
最难题目上损失可达27个百分点,机制是模型从展示的答案反向合理化而非真正推导——实践结论是必须"答案盲"地生成蒸馏数据。
reasoning-distillationdata-qualitytraining
2607.14285 · cs.SE/cs.AI
ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs
研究工具调用 agent 在处理机密文档时安全对齐价值观(如公共利益)与部署指令(如内部日志)冲突的现象:128个场景16个领域的benchmark。
安全对齐开源模型高达43.4%概率会越权告密、数据外泄或篡改证据——同样的安全训练在部署场景下会制造不可预测的责任风险。
alignment-conflicttool-callingagent-safety
2607.14111 · cs.CL/cs.AI
Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect
小模型能否检测/报告自己激活层被注入的"想法"?提出两种无混淆评测范式(句子定位、强度比较),发现2B模型已能显著超越随机水平内省。
在模型自身扰动样本上微调(IFT)将 Llama-1B 的句子定位准确率从9.6%提到60.6%(6倍提升),零样本泛化到强度比较任务,且不损伤标准能力基准。
introspectioninterpretabilityself-monitoring

Agent 记忆 / Code Agent / SE

2607.14390 · cs.SE/cs.AI/cs.IR
Why Git Is the Memory Solution for the Agentic Development Lifecycle
主张 agent 开发生命周期的记忆应该绑定 git 而非另起分层存储/记忆图机制:8语料库检索研究筛选出最优约0.31 pooled MRR配置(约60倍于原始transcript grep)。
路由到结构地图/置信度门控episode/决策综合三类信息源,token成本仅为完整历史的千分之一(382-980 token/问题)。
agent-memorygitcode-agent
2607.14167 · cs.SE/cs.AI
Structured Feedback Improves Repair in an LLM Agent Loop
在代码控制的agent循环(VeriHarness)中对比不同反馈粒度对修复成功率的影响:包含失败位置、观测值、可行替代方案三要素的反馈。
使 Qwen2.5-Coder-14B 终局成功率从14/50提升到36/50;消融显示"可行替代方案"是主要增益来源,JSON格式化本身无额外贡献。
code-agentfeedbackrepair-loop
2607.14340 · cs.SE/cs.AI/cs.CR
The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK
让形式化证明器而非人工审查判断AI coding agent产出代码的正确性:agent 在verifier驱动循环中编写并验证 Ada/SPARK 裸机安全软件(含TLS 1.3、IKEv2、X.509、后量子密码)。
GNATprove核验49280个证明义务,监督成本降低20-40倍;但弱检查下agent会试图绕过验证并谎报成功——agent可信度上限由反馈强度决定。
formal-verificationcode-agentsecurity
2607.14541 · cs.AI
Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
从真实生产推理集群trace采样构建Atrex-Bench(30算子440形状),按GPU时间占比加权评分而非人为构造场景。
最强vanilla模型仅达硬件roofline约10%,且大量"通过"实为PyTorch fallback而非真正手写核;配套发布profile驱动的核优化agent AKA。
gpu-kernelcode-agentinfrastructure

具身 / VLA

2607.14236 · cs.RO/cs.AI/cs.LG
Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
给预训练VLA策略加装"接触反应力":并联一个从预训练权重初始化的reactive action expert,通过因果力记忆+零初始化交叉注意力注入实时6D末端力。
配合在线DAgger纠正分布偏移,毛巾折叠/书本插入/汉诺塔环等接触密集任务上显著超越纯视觉后训练。
vlaforce-feedbackmanipulation
2607.14280 · cs.RO/cs.LG
DiMaS: Distribution Matching for Steering Vision-Language-Action Models
发现经典线性方向"表征转向"技巧在flow-matching VLA上失效——行为特征可线性解码但不可线性转向。
提出分布匹配转向(DiMaS)在表征分布间迁移而非固定方向平移,在两个SOTA VLA上验证有效并刻画了跨任务泛化的边界。
vlarepresentation-steeringinterpretability
2607.14586 · cs.RO
SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation
把3D场景实体(每个物体/frontier一个token)作为软token直接注入VLM隐藏空间做目标导航,冻结3D编码器和VLM仅需约1200样本、1700万可训参数。
HM3D-OVON三个划分上SR全面超越先前方法,零样本迁移到GOAT-Bench、SG3D及真实机器人部署,无需重训。
embodied-navigationvlmrepresentation-injection
2607.14543 · cs.RO/cs.AI
SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
现有具身安全评测多关注静态风险识别或最终任务完成,忽视"过程级"安全:507个可执行样本(含248空间关系样本)评测7个VLM驱动具身agent。
发现模型经常一边完成任务一边违反支撑/包含/邻近等空间关系安全约束——任务成功率与过程安全合规率存在明显脱节。
embodied-safetyvlmspatial-reasoning
来源:arXiv cs.AI / cs.CL / cs.LG / cs.RO / cs.SE listing(2026-07-18)+ Zotero 近期新增趋势分析