← 首页|学术|ArXiv 日报 — 2026-07-11
学术 · 2026年7月11日

ArXiv 日报

全双工评测 · 双系统架构 · 低延迟 Agent · Tail-Aware RL
全双工 1篇 你的领域 9篇 代码Agent / SE 2篇 具身 / VLA 2篇 推理基础设施 1篇
249
今日总数
15
精选
9
你的领域
2
代码Agent
2
具身/VLA
1
基础设施
今日亮点:全双工评测首个系统性可靠性报告(2607.07985),用 Gemini 多模型音频 judge 对 209 段立体声会话打分,直接服务 duplex agent 训练管道。双系统架构今日两连击:FSD-VLN(2607.08359)将 Fast-Slow 双层分工引入无人机长时域导航,与 DuplexOmni 的 S1/S2 异步架构完全同构。Tool-Making(2607.08010)在低延迟系统中实现 agent 自演化。RL 训练侧:Tail-Aware Credit Calibration(2607.07976)填补 GRPO 等 critic-free 方法的长尾 token 信用分配漏洞。
  1. 你的领域:全双工 · Agent 架构 · Agentic RL
  2. RL / 训练
  3. 代码 Agent / 软件工程
  4. 具身 / VLA
  5. 推理基础设施

你的领域:全双工 · Agent 架构 · Agentic RL

2 · cs.RO cs.AI · 2607.08359
FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation
无人机执行长时域 VLN 任务时,既需要高层语义推理又需要低延迟飞控响应——这与 DuplexOmni 的 Interaction Layer(S1)+ Thinking Layer(S2)异步双层架构在动机上完全同构。FSD-VLN 将导航决策分解为 Fast(反应式执行)和 Slow(深度规划)两个并行系统,实现实时飞行中的高质量语言理解。双系统架构从语音交互迁移到空中导航的直接佐证,设计模式具有跨领域可迁移性。
Fast-SlowVLNDual-SystemAerial
3 · cs.CL cs.LG cs.SE · 2607.08010
Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
生产 agent 每次请求都重新推理生成相同 SOP 步骤,浪费延迟。本文提出 agentic tool-making pipeline:在部署前将重复性 SOP 步骤编译为经过验证的版本化工具——agent 从执行跟踪和后端 schema 中自动生成、验证并迭代工具,部署时只需调用而非推理。双重价值:降低端到端延迟(直接相关于全双工实时交互)+ 让 agent 随环境积累自演化,而非依赖静态训练数据。
Low-LatencyTool-MakingAgent-EvolutionSOP
4 · cs.AI · 2607.07984
Agentic Neural Architecture Search
NAS 的核心障碍是搜索空间需要大量人工先验,且需为每个新任务重建。本文用 LLM 驱动开放搜索空间设计:LLM 在宽泛空间内生成架构候选,NAS 引擎快速过滤验证——清晰划分 LLM 创意生成 vs. NAS 系统搜索的劳动分工。意味着 agent 可以端到端地参与自身架构优化,而非只优化权重,是 agentic self-improvement 的架构层探索。
NASAgent-ArchitectureSelf-Optimization
5 · cs.CR cs.AI cs.MA · 2607.07989
Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
Multi-agent 系统出错时,定位"哪个 agent 在哪一步导致了不可逆偏转"极其困难——长时域交互、agent 间信息传递、延迟错误效应相互叠加。本文提出失效溯源框架,在轨迹中标记最早偏转点并定位责任 agent,无需干预实际执行。对构建可调试的 multi-agent 系统有工程价值,也为 safety 研究提供精细诊断工具——补充昨日 Operational Reframing(2607.07097)的安全评估框架。
Multi-AgentFailure-LocalizationDebugging
6 · cs.AI cs.CL cs.SE · 2607.08028
From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
企业 LLM agent 从原型 prompt 到生产级可审计架构的工程路径。本文用"合约"替代 prompt——确定性行为边界、实体路由规则、答案合约、可复现追踪——将 agent 的每一个决策点变成可审计的显式记录。与昨日 Harness Effect(2607.06906)形成呼应:如果 harness 设计决定 token 经济,harness 工程化就是成本可控的执行路径。
Enterprise-AIHarnessAuditableAgent-Architecture
7 · cs.AI cs.HC cs.LG · 2607.07859
Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
现有 agent 对齐方法遵循 contextual bandit 框架,忽视了 sequential decision-making 中反馈信号的精细控制。本文在离线模仿学习场景中提出Feedback Manipulation Regularization(FMR):在利用人类演示进行 agent 对齐时,显式正则化"看起来遵循反馈"的表面策略,防止 agent 学会操纵反馈信号而非真正内化对齐目标。对构建真正对齐的 agentic 行为有方法论贡献。
Agent-AlignmentImitation-LearningOffline-RL
8 · cs.CL · 2607.07820
DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
训练 web search agent 从自身经验改进的难题:SFT 依赖固定教师轨迹,稀疏奖励 RL 对长时域交互监督信号太弱。本文构建 DeepSearch-World——一个确定性、可验证的 web 环境,让 agent 通过自蒸馏从成功轨迹中提炼高质量训练信号,无需外部教师。与今日 Tool-Making(2607.08010)的 agent 自演化思路互补,两者共同勾勒出 agentic self-improvement 的两条技术路线。
Search-AgentSelf-DistillationAgentic-RLVerifiable
9 · cs.AI cs.CL cs.LG · 2607.08196
A First-Principles Theory of Slow Thinking and Active Perception
从第一性原理出发,对"慢思考"和"主动感知"给出数学形式化——以概率分布的 lifting 与 projection 为起点,推导出 extended reasoning LLM 的设计、训练和推理统一框架。核心洞察:慢思考本质上是主动感知的一个特例——模型通过在潜在推理空间中搜索来主动改变其感知输入。对理解 o1/o3/R1 类模型边界条件有理论价值;也为全双工 agent 中的 Thinking Layer 提供了主动感知的理论视角。
Slow-ThinkingActive-PerceptionTheoryExtended-Reasoning

RL / 训练

10 · cs.CL cs.AI cs.LG · 2607.07976
When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning
GRPO 等 critic-free RL 方法对所有 token 均匀分配相同 advantage,但低概率 token(distribution tail)的 advantage 信号是高方差噪声——被错误强化后会破坏生成质量和推理稳定性。本文定义 Positive-Credit Contamination 失效模式,提出 Tail-Aware Credit Calibration:根据 token 边际概率动态调整信用分配,防止 implausible token 被强化。对 GRPO/PPO 驱动的 agentic RL 训练稳定性有直接改进意义。
RLCredit-AssignmentGRPOTraining-Stability

代码 Agent / 软件工程

11 · cs.SE cs.LG · 2607.07946
DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
SWE-bench 的两大问题:(1)数据污染——GitHub PR 在预训练时可能已被见过,高分可能反映的是记忆而非问题解决;(2)任务粒度过细——每个任务附属于单一 PR diff,缺乏长时域工程结构。DeepSWE 包含 113 个原创长时域 SE 任务,确保训练集无污染,要求 agent 从需求分析到实现验证完整解决工程问题。为评估代码 agent 真实 frontier 能力提供了更可靠的 benchmark。
Code-AgentBenchmarkLong-HorizonSWE
12 · cs.SE cs.LG · 2607.08124
TTHE: Test-Time Harness Evolution
LLM agent 的行为由模型 + harness 共同决定。现有方法在部署前优化 harness 后冻结——但测试分布的多样性使固定 harness 难以应对所有情况。TTHE 让 harness 在测试时根据任务特征自适应演化:上下文构建策略、工具调用时机、失败恢复逻辑均可动态调整。与今日 From Prompts to Contracts(2607.08028)构成方向互补——后者强调确定性合约,前者强调自适应演化。
Code-AgentHarnessTest-Time-Adaptation

具身 / VLA

13 · cs.CV cs.AI · 2607.08182
LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
大多数 VLA 均匀处理所有视觉 token,缺乏对任务关键证据的显式强调。LEEVLA 引入潜在环境演化模块,在生成动作前先预测场景的任务相关动态变化,从而"看到重要的"而非全量视觉信息。与 DuplexOmni 的 ghost text 机制有类比——都是在最终输出前增加隐式"预思考"步骤来提升质量。在复杂动态场景和少样本泛化上表现优于均匀注意力基线。
VLALatent-DynamicsVisual-AttentionRobotics
14 · cs.CV cs.AI cs.RO · 2607.08375
WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
现有端到端自动驾驶 VLA 要么缺乏世界认知,要么预测碎片化,限制了从"反应式"到"主动式"驾驶的跃迁。WCog-VLA 提出双层世界认知框架:高层语义世界预测 + 低层运动轨迹规划,两层融合后输出驾驶动作。今日第三次出现的双层架构——FSD-VLN(导航)、DuplexOmni(对话)、WCog-VLA(驾驶)——共同印证"分层推理 + 快速执行"作为复杂实时任务的通用设计模式。
VLAAutonomous-DrivingDual-LevelWorld-Model

推理基础设施

15 · cs.CL · 2607.08186
Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
Transformer 主干扩展需要全量重新预训练,但已有强模型是否可在固定主干前提下通过"每 token 更多计算"持续提升?深度循环 Transformer 沿此方向探索但难以整合进现有推理系统。本文提出 Hidden Decoding——在现有 backbone 上叠加轻量级 latent computation 层,实现 compute-per-token scaling 而无需更改主干或重新预训练。对 agent serving 系统的 compute-quality 动态权衡有直接工程价值,尤其适合延迟敏感场景。
InferenceLatent-ComputationScalingKV-Cache
数据来源:arXiv cs.AI / cs.LG / cs.CL / cs.SE / cs.RO / cs.CV — 2026-07-11 · 精选 15 篇 / 249 篇