← 首页|学术|ArXiv 日报 — 2026-08-05
学术 · 2026年8月5日
ArXiv 日报
Agent 安全 · Agent 架构与推理基础设施 · Agent 记忆 · 代码 Agent · 具身/VLA
🎯 今日重点:今天最显眼的是一整簇 agent 安全 论文集中出现——从记忆投毒防御(MAPLE-Guard)、多agent流水线的结构性漏洞(对抗攻击)、协作场景下的"集体阈值后门"新攻击范式,到一篇给整个agentic安全领域画路线图的立场文章(Securing Agentic AI)。同时几篇推理基础设施论文也值得关注:AiFlow 把流式LLM应用的编排做成token级响应式架构,RING 用参数化记忆内化取代外部检索。今日无 duplex/turn-taking 方向新论文。
🛡️ Agent 安全:从记忆投毒到集体后门
2608.00426 · cs.AI/cs.MA
多agent系统依赖持久化私有/共享记忆做长程协调,这给了攻击者一条持久通道:一次投毒写入可以被反复检索、晋升进共享记忆、被其他从未见过原始攻击的agent复用。MAPLE-Guard在记忆生命周期的写入、检索、晋升、跨agent复用四个节点设卡。
可疑记忆隔离、不安全检索过滤、投毒私有记忆在进入共享记忆前拦截。在LongMemEval上把攻击成功率从38.2%降到0.9%,在AppWorld上从34.7%降到0.2%——是目前少见的专门针对"记忆层"而非prompt层或通信拓扑层的防御设计。
memory-poisoningmulti-agent-securitydefense-mechanism
2608.00718 · cs.AI/cs.CR
多agent流水线里一旦某个agent接受了对抗性内容,它就会作为可信输入在流水线里继续传播——论文认为这源于缺少"边界验证"这个安全原语(对内容、身份、执行意图、状态完整性的显式校验)。
用GAIA和SWE-Bench的生产轨迹证明这类漏洞在良性部署里就会出现,并在GPT-5-mini、Claude Sonnet 4.5、Kimi K2.5上用同一套pipeline配置复现,发现攻击成功率和pipeline结构相关而非模型能力相关——说明对抗脆弱性本质上是一个架构属性。
adversarial-attacksmulti-agent-pipelinearchitectural-vulnerability
2608.01085 · cs.MA/cs.CR
提出一种新的MAS后门范式:后门行为的激活不由任何单条消息决定,而是由"同伴证据积累到隐藏阈值"触发。BCBI构造反事实边界对,把阈值前的良性行为和阈值后的对抗目标分离。
配套的LATTE防御只用干净数据学习良性通信动态,在不知道攻击目标或触发条件的情况下就能隔离异常agent更新——这种"集体阈值"攻击面此前很少被系统研究,值得和MAPLE-Guard一起看作记忆/协作层安全的两个互补切面。
backdoor-attackmulti-agent-securitycollective-trigger
2608.01558 · cs.AI/cs.CR
一篇给整个agentic安全领域画路线图的立场文章:论证agent的安全性不取决于单个动作的正确性,而取决于整体行为是否始终符合系统的规则和不变量。
梳理了单agent层(prompt/memory/工具接口的攻击面)、多agent层(身份、信任、能力控制、决策透明度)、更宽泛层面(模型路由和执行控制平面、供应链完整性、可追溯性)三个层级的挑战——可以当作理解今天这一整簇安全论文的整体框架来读。
agentic-ai-securitytrajectory-assurancesecurity-roadmap
你的领域:Agent 架构与推理基础设施
2608.00028 · cs.MA/cs.AI
反驳了最近一篇提出"扁平多agent系统存在不可消除的因果地板、只能靠层级化架构突破"的论文。用受控扰动抑制测试床证明:只要单个agent携带匹配扰动的内部模型,扁平同构群体在相同人均memory下能匹配甚至超过两层层级设计。
时间深度可以是"动态的"(循环记忆)而非"架构的"(嵌套)。给出width×memory×delay三资源交换关系图和四条设计规则,对判断"要不要上层级化多agent架构"这个常见工程决策很有参考价值。
multi-agent-architectureresource-accountinghierarchy-vs-flat
2608.00558 · cs.DC/cs.AI
流式LLM应用(检索+工具调用+安全过滤+多agent协调)目前大多把生成当粗粒度请求-响应步骤处理,队列管理、并发和背压全靠临时回调代码兜底。AiFlow把provider的token增量归一化成有类型的事件,在有向流图里传播。
每个节点由"Node Guardian"强制执行本地队列上界、并发数、顺序和溢出策略,并给出有界内存性质的形式化证明。相比聚合式生成把应用层TTFPT降低70.9-94.7%——虽然本身不是duplex方向,但其token级事件流处理思路对全双工交互架构有直接借鉴价值。
streaming-llmreactive-orchestrationbackpressure
2608.01652 · cs.MA/cs.AI
多agent协调在效率和适应性之间长期存在权衡:反复调用LLM做多轮通信能适应动态环境但延迟高,一次性规划省开销但容易过时失效。SyncPlan用集中式协调器单次调用生成每个agent的动作链。
执行时用显式wait原语和死锁检测强制agent间/agent-环境依赖,轻量级"计划陈旧度检测器"持续评估剩余计划并按需触发重规划。在Overcooked和《王者荣耀》环境上用不到0.05%的wall-clock时间达到SOTA成功率。
multi-agent-coordinationlong-horizon-planningadaptive-replanning
2608.00181 · cs.AI/cs.LG
RL训练在自封闭环境里容易学到利用环境特异性规律(工具schema、grader解析方式)而非可迁移技能,同分布holdout测试无法区分这两者。论文在363个跨27类别的MCP长程任务上做SFT+RL两阶段后训练一个MoE模型,训练时完全不接触外部benchmark任务或grader。
结果在Toolathlon、τ²-Bench、BFCL-V4、SWE-Bench Pro、Terminal-Bench 2五个外部评测上全面提升,且两个软件工程benchmark的提升发生在训练集完全不含SE任务的情况下——为"训练出的能力到底有没有泛化"提供了行为层面而非分数层面的判据。
cross-benchmark-generalizationlong-horizon-rlmcp-training
Agent 记忆
2608.01630 · cs.CL/cs.LG
RAG提升事实性但在serving时带来延迟和工程开销。RING把大规模外部知识注入一个"Mixture-of-Memory Experts",通过强化学习让模型在这个内部记忆上学习参数化搜索策略,完全去掉外部检索器。
用严格排除预训练截止日期之前新闻的News-2025 benchmark验证真正的新知识注入,效果匹配或超过基于检索的RAG和参数化注入基线——是"把检索能力内化进参数"这条路线的一次扎实推进。
agent-memoryretrieval-internalizationknowledge-injection
2608.01672 · cs.LG/cs.CL
有效的长上下文建模不只是记住更多过去,而是保留未来可能有用的信息——但现有测试时训练(TTT)方法只优化重建或在线适应目标,都没考虑保留信息的"未来效用"。TTCD用一个长窗口教师监督短窗口学生的快权重。
两者隐藏状态的差异提供密集自监督信号,在长上下文语言建模上稳定超过DeltaNet、Gated DeltaNet、滑窗注意力和原版TTT——把TTT的目标函数从"记住过去"重新定义成"为未来筛选记忆"这个更贴近agent记忆场景的问题。
test-time-trainingcontext-distillationlong-context-memory
2608.01708 · cs.CL/cs.AI
长期个性化对话agent需要随用户人设演变持续追踪偏好,但现有记忆系统把人设存成脱离具体事件的扁平画像,导致"记忆-人设有效性缺口"和"人设感知检索缺口"。PGMem用异构图把事件节点和人设节点通过带类型的溯源/证据边连接。
在三个benchmark、小模型backbone下持续超过摘要式、人设感知式、图结构式和agentic记忆基线,且随上下文增长性能持续提升——把"人设可信度"显式建模成可追溯、可验证的图结构。
agent-memorypersona-trackingmemory-graph
代码 Agent / 软件工程
2608.00267 · cs.SE/cs.AI
coding agent基础设施正从"脚手架工程"转向"循环工程"——agent被部署做持续的长程软件开发,但现有benchmark大多聚焦局部任务或终态结果,对持续执行过程缺乏洞察。LoopsBench用112个任务构成依赖DAG。
流感知运行时沿就绪前沿释放测试并把已完成节点保留为回归义务。最强配置(Opus-4.7 + Claude Code + 外层续接)只解决25%的任务——量化证明了"长程执行状态维护"本身就是一个远未解决的独立难题。
coding-agent-benchmarkloop-engineeringlong-horizon-execution
2608.00808 · cs.SE/cs.AI
长程coding agent的轨迹里积累几百个动作和观察,但没有任何东西标明哪些观察仍然准确描述当前仓库状态——模型只能隐式地从原始历史里推断执行状态,推断失误就会操作过期文件内容或重复已完成的工作。Ledger是一个确定性运行时层。
把已完成的交互蒸馏成显式执行状态,在命令执行前对照ledger校验并返回仍然有效的历史结果替代重新执行。在全部500个SWE-bench Verified实例上把GPT-5 mini的Pass@1从56.2%提到64.2%,同时降低28.9%总成本——直接呼应LoopsBench发现的问题,给出纯运行时层面的解法。
coding-agentexecution-stateruntime-layer
2608.01507 · cs.SE/cs.AI
当前coding agent普遍认为"委托子agent做隔离上下文窗口的深度探索"(Deep Agentic Search)是防止主agent上下文污染的最佳实践,Claude Code、Codex等都已采用,但论文首次系统对比发现语义检索反而更优。
在SWE-QA上,deep agentic search以46.2%比65.2%的正确率输给传统语义检索,每个正确答案成本却更高。失败分析显示最大失败类别(41.8%)发生在规划者和子agent的交接处,往往是"流畅自信但错误"的沉默失败——对"上下文工程最佳实践"提出了有实证反例的警示。
coding-agentcontext-engineeringretrieval-vs-agentic-search
具身 / VLA
2608.01428 · cs.RO/cs.MA
具身agent频繁重规划以应对执行漂移、部分可观察性和协调风险,但每次基于LLM的重规划调用会消耗随时间和agent数量增长的文本上下文,上下文变大后重规划延迟出现长尾、即使任务成功率仍高也会错过实时截止时间。BRACE把重规划表述成预算化控制回路。
决定是否重规划、选择重规划模式、分配显式token预算和延迟SLO。在Meta Habitat、RoboFactory、AirSim上把重规划调用的token数降低62-92%,SLO违规率从85.5-100%降到4.7-50%——是"重规划本身开销失控"这个具身agent常见痛点的系统化解法。
embodied-agentbudgeted-replanningtoken-efficiency
2608.01402 · cs.RO/cs.AI
VLA模型在需要精确物理接触的任务上表现挣扎,此前工作多用力增强架构和训练时正则化直接应对接触失败,但根因一直未被充分探究。论文识别出两种独立失败模式:精度失败源于flow-matching策略的训练-推理不匹配,力失败源于力信号本身的结构特性。
针对每种失败设计对应机制、组合成FACT。在五个接触密集任务、近2500次真实世界rollout上,平均成功率达到66%(最强先前基线41%)——把"VLA为什么在接触任务上失败"拆解成两个可分别针对的具体机制。
vision-language-actioncontact-rich-manipulationfailure-analysis
来源:arXiv cs.AI / cs.LG / cs.MA / cs.RO / cs.CL / cs.SE / cs.CV 新增列表(2026-08-05)+ Zotero 近期新增趋势分析(Agent Training / GUI & Web Agents / Agentic RL / Agent Architecture)