← 首页|2026-07-10-arxiv-briefing
学术 · 2026年7月10日

ArXiv 日报

企业 Agent 成本 · Agentic RL · 代码评估 · 具身VLA
你的领域 8篇 代码Agent / SE 4篇 具身 / VLA 3篇 推理基础设施 1篇
~290
今日总数
16
精选
8
你的领域
4
代码Agent
3
具身/VLA
1
基础设施
今日亮点:企业 agentic AI 成本两连击——Harness Effect(2607.06906)揭示 orchestration 设计才是 token 成本的真正控制变量;Progressive Crystallization(2607.07052)提出让 agent 探索成本从"每次运行"变为"一次性投资"的三阶段生命周期。多任务 agentic RL(2607.07178)和 multi-teacher 蒸馏行为杠杆(2607.07050)填补训练侧重要空白。
  1. 你的领域:企业AI · Agentic RL · 推理理论 · 评估
  2. 代码 Agent / 软件工程
  3. 具身 / VLA
  4. 推理基础设施

你的领域

1 · cs.AI · 2607.07052
Progressive Crystallization: Turning Agent Exploration into Deterministic, Lower-Cost Workflows in Production
IT 运维 agent 每次执行都需要全量 LLM 推理,即使同一问题已被解决过。Progressive Crystallization 把 agent 定义为三阶段生命周期:探索 → 提炼为可复现配方 → 晶化为确定性低成本 workflow。实质是把 agent 的"探索成本"变成一次性投资,而非每次运行的固定成本——对 enterprise agentic AI TCO 有直接影响。与下方 Harness Effect 构成成本优化的互补视角:一个看运行时编排,一个看能力积累路径。
Agent-ArchitectureProductionEnterprise-AI
2 · cs.AI · 2607.06906
The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
企业 agentic AI 正陷入"token 极大化"陷阱:用更长推理链、更多轮次、更大工具 payload 购买能力,导致每任务 token 消耗增速远超任务价值。本文论证决定性杠杆是 harness 设计而非 token 单价——harness 控制什么信息进入上下文、何时调用工具、如何截断轨迹,是 agent 成本的真正控制变量。token 降价反而会掩盖问题(总花费仍在涨)。
Enterprise-AIToken-EconomicsHarness
3 · cs.AI · 2607.07097
Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety
多 agent 安全评估通常把 planner-executor pipeline 效应作为单一数字上报。本文拆解出三种独立机制:有害意图被重构为合理运营工作(operational reframing)、planner 主动拒绝或稀释请求、executor 能力降低。三机制方向不一,聚合后相互抵消,导致"安全得分"不可解释。为 multi-agent safety 提供了更精细的分析框架。
SafetyMulti-AgentEvaluation
4 · cs.LG · 2607.07178
Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning
现有 agentic RL 几乎只处理单任务,但实际部署需要多任务通用 agent。本文发现多任务 agentic RL 的核心障碍是各任务熵崩溃不同步——某些任务过早收敛导致策略早熟。提出 Entropy Pacing Policy Optimization(EPPO),根据各任务当前熵水平动态调整学习节奏,实现更平衡的多任务泛化。填补了 agentic RL 在多任务场景的重要空白。
Agentic-RLMulti-TaskEntropy
5 · cs.LG · 2607.07050
Behavior Leverage Imbalance in Multi-Teacher On-Policy Distillation
Agentic 语言模型需要同时学会何时调工具、何时消费工具返回、何时直接回答——自然适合多教师 on-policy 蒸馏。本文发现学生自生成分布中工具调用与直接回答比例严重失衡,导致某一行为类型的教师监督信号欠采样——提出 behavior leverage 指标量化这一问题并给出修正方法。与昨日 TurnOPD(2607.05804)的 turn-awareness 构成 agentic 蒸馏的互补视角。
DistillationTool-UseAgentic-RL
6 · cs.AI · 2607.06648
Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories
隐式推理(latent reasoning)在连续隐状态中执行多步推理,但这些隐状态是否真正因果驱动最终答案?先前工作只检验收敛检查点。本文沿训练轨迹全程分析忠实性,发现忠实性呈非单调动态——最终检查点忠实不代表训练全程忠实,也不代表中间步骤真正进行了推理。对隐式推理研究的评估方法论提出修正要求。
Latent-ReasoningFaithfulnessTraining
7 · cs.AI · 2607.06720
When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning
将 extended reasoning 中的 in-context search 形式化为对推理轨迹的近似推断——基础模型定义先验、自我反思提供似然更新。在此框架下推导 in-context search 有效的充分条件:基础模型需对正确解有非平凡覆盖,反思需提供真实似然信号而非噪声。对理解 o1/o3/R1 类推理的适用边界有价值,也预测了何时更多反思反而有害。
ReasoningTheoryReflection
8 · cs.AI · 2607.07040
Measuring Intelligence Beyond Human Scale
当模型能力超越人类时,人类出题者可能无法判断哪些任务既足够难又可验证——这是绝对量表评估的内在困境(ARC-AGI 类 benchmark 的天花板问题)。本文提出基于相对测量的新范式:模型自己生成公开挑战,其他模型应答,形成竞争均衡作为能力量尺。实质上是把 benchmark 构造本身变成智能评估的一部分。
EvaluationSuperhumanBenchmark

代码 Agent / 软件工程

9 · cs.SE · 2607.06624
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
大多数代码 agent benchmark 把一次运行压缩为单 bit(通过/失败),但真实用户体验的是整条轨迹:是否遵循指令、工具使用是否合理、如何从错误中恢复。AgentLens 引入生产级轨迹审查,提供细粒度中间步骤评估——直接对齐真实用户满意度而非合成测试通过率。与昨日 SCOPE(2607.05810)的子目标批评机制构成代码评估的互补工作。
EvaluationCode-AgentTrajectory
10 · cs.SE · 2607.06636
Specification Grounding Drives Test Effectiveness for LLM Code
LLM 生成代码的常见修复策略是让模型自己写测试、修复直到通过——但收益来源不清楚。本文拆解发现真正收益来源是 specification grounding:当测试被锚定到自然语言规范的边角条件时,测试驱动修复才真正有效;否则只是对已有行为分布的重新采样,无法覆盖规范空白。对"自我修复代码"研究路线有重要方法论含义。
Code-GenerationTestingSpecification
11 · cs.SE · 2607.06713
Reliable and Developer-Aligned Evaluation of Agents for Software Engineering
当前 SE agent 评估有两个系统性缺陷:碎片化(各 benchmark 评估不同子能力,无统一视角)和失真投影(合成任务与真实开发工作流分布差距大)。本文提出开发者对齐的评估框架,将评估维度与开发者真正关心的交付物(pull request、review 评分、CI 结果)对齐——补充了昨日 AgentLens 的轨迹维度,从"何为好结果"的角度重新定义 SE agent 评估。
EvaluationCode-AgentSoftware-Engineering
12 · cs.SE · 2607.06873
Mining Workflow Graphs for Black-Box Boundary Testing of Conversational LLM Agents
对话式 LLM agent(客服、预订系统等)存在隐藏的状态机边界——确认门、身份验证节点、条件分支——这些边界隐藏在多轮对话前提之后,传统黑盒测试无法直接触达。本文从 agent 交互日志中自动挖掘 workflow 图,然后基于图结构系统性生成能触达边界条件的测试用例——对 production agent 的测试覆盖度问题给出了具体工程解法。
TestingConversational-AgentWorkflow

具身 / VLA

13 · cs.RO · 2607.06655
Pelican-VLA 0.5: Attending Before Acting Benefits Generalization
Pelican-VLA 0.5 将视觉语言理解、未来帧生成、动作预测统一为单一架构。核心发现:在动作生成前显式执行注意力(attending before acting)能实现注意力级泛化——无需物体标注、分割掩码、注意力监督或任务特定微调,即可在新物体和新场景上泛化。是"先理解场景再行动"这一直觉的系统性验证。
VLAGeneralizationAttention
14 · cs.RO · 2607.06988
WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time
把机器人基础模型导向新任务变体通常需要机器人演示、任务特定微调或长上下文条件化。WAM-TTT 提出测试时训练框架,直接从原始人类操作视频在测试时更新模型——无需机器人演示,把"看人类做"转化为策略调整信号,大幅降低机器人基础模型适配新行为的成本。与 test-time compute 的 scaling 思路形成有趣对比。
RoboticsTest-Time-TrainingWorld-Model
15 · cs.RO · 2607.07101
GeoProp: Grounding Robot State in Vision for Generalist Manipulation
本体感知(proprioception)对机器人操控至关重要,但现有融合方法把关节角度向量和视觉 token 当作独立流,缺乏三维运动学与二维特征图之间的显式对齐。GeoProp 将机器人状态锚定到视觉场景中的对应位置,让策略能"看到"机器人在场景中的物理位置,显著改善通用操控策略性能——解决的是 VLA 中的空间感知接地问题。
RoboticsProprioceptionManipulation

推理基础设施

16 · cs.LG · 2607.07144
Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference
KV cache 量化后得到码书索引流,现有方案的存储和检索效率仍有提升空间。本文研究量化后的符号流如何最优存储,提出分形压缩存档结构,实现原位检索(无需解压)——与量化、驱逐、卸载等现有方法正交,在不损失精度的前提下进一步降低长上下文推理的存储开销。对于长上下文 agent 系统的服务成本有直接价值。
InferenceKV-CacheInfrastructure
数据来源:arXiv cs.AI / cs.LG / cs.SE / cs.RO — 2026-07-10 · 精选 16 篇 / ~290 篇