← 首页|学术|ArXiv 日报 — 2026-07-14
学术 · 2026年7月14日

ArXiv 日报

SLM Harness · KV-PRM · Sticky MoE · Chat-to-Agent Steering
你的领域 5篇 RL / 训练 3篇 推理基础设施 2篇 代码Agent / SE 3篇 具身 / VLA 2篇
226
今日总数
15
精选
5
你的领域
3
RL / 训练
2
推理基础设施
5
代码+具身
今日亮点:SLM agent 90% 成本降低(2607.08938)通过自动 harness 适配让小模型匹配大模型性能,是 harness 工程三连击的最后一块;KV-PRM(2607.09153)首次将 KV-Cache 复用嫁接到 PRM 评分,解决 multi-agent TTS 场景下评分成本二次增长问题;Sticky Routing(2607.08780)从训练侧解决 MoE 边缘推理的 expert 切换开销;Chat-to-Agent Activation Steering(2607.09156)发现方向向量在 agent 场景"Present but Rescaled",为 agent 可操控性研究提供首个迁移基准。
  1. 你的领域:Agent 架构 · Agentic RL · 评估
  2. RL / 训练
  3. 推理基础设施
  4. 代码 Agent / 软件工程
  5. 具身 / VLA

你的领域:Agent 架构 · Agentic RL · 评估

3 · cs.AI · 2607.08964
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
现有终端 benchmark 主要关注"几分钟内能完成的简短任务"且仅评估最终结果——稀疏奖励下 agent 表现被严重低估。Long-Horizon-Terminal-Bench 引入密集奖励评分(dense reward-based grading),追踪中间进度和部分解,能区分"差一点就做到了"和"完全没有方向"的两种失败。与 DeepSWE(2607.07946)共同推进长时域 agent 评估精细化。
BenchmarkLong-HorizonDense-RewardEvaluation
4 · cs.AI cs.LG · 2607.08894
GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
LATS/ReAct 类方法在规划中重度依赖 LLM 推理,计算成本高且行为随机。GATS 用分层 World Model + 图增强树搜索替代每步的 LLM 推理——高层约束全局方向,低层评估局部动作,图结构跨轨迹复用已有计划节点。实质是把 agent 规划的"反复推理"成本转移到 World Model,与今日 KV-PRM 的 KV-Cache 复用构成计算效率的两条平行路线。
Agent-PlanningWorld-ModelTree-SearchEfficiency
5 · cs.AI cs.CL · 2607.08774
CogniConsole: Externalizing Inference-Time Control as a Formal Abstraction for Reliable LLM Interactions
可靠性通常被当作模型能力的函数,但本文论证可靠性的关键在于推理时控制层——决定任务如何被框架化、哪些上下文被选入、何时终止。CogniConsole 将 inference-time control 形式化为独立于模型的抽象层,使控制逻辑可审计、可测试、可替换,不需要修改模型本身。是 harness 工程化思路的理论化版本,为 agent 可靠性研究提供了新的分析切口。
ReliabilityInference-ControlAgent-ArchitectureFormal-Abstraction

RL / 训练

6 · cs.LG cs.RO · 2607.09042
Learning More from Less: Reinforcement Learning from Hindsight
VLA 模型的 RL 后训练面临严重的样本效率问题:早期策略几乎每次 rollout 都失败,稀疏奖励下几乎没有可学习的正向信号。本文提出 RL from Hindsight:从失败轨迹中回溯构造 reward——把"失败的完整尝试"拆解为"某一步骤局部成功"的后验标注,为空奖励轨迹提供密集监督信号。专为机械臂 VLA 设计,但方法原理对 agentic RL 冷启动问题普适适用。
Agentic-RLHindsightSample-EfficiencyVLA
8 · cs.LG cs.AI · 2607.09053
An Emergent Mirage: Is Emergent Misalignment and Realignment Indeed a Robust Phenomenon?
近期报道了"Emergent Misalignment"——特定领域微调后模型涌现出广泛的不对齐行为,且可通过少量重对齐数据逆转。本文系统复现该实验,对不同模型家族重复对齐/反对齐循环,发现该现象稳健性远低于原文报告:部分家族根本不涌现,且重复循环后行为高度不稳定。为"某种特殊训练会让模型全局变坏/变好"的叙事提供了严重质疑。
AlignmentEmergent-MisalignmentRobustnessFine-Tuning

推理基础设施

9 · cs.LG cs.CL · 2607.08775
HALO: Hybrid Adaptive Latent Reasoning for Language Models
如何在不修改预训练 LLM 主干的前提下提升能力?HALO 在 backbone 隐状态顶部加入自适应轻量 refinement head:根据任务难度动态决定是单步 refinement(快)还是多步(强),在计算预算与质量之间取得更优权衡。与 Hidden Decoding(2607.08186)同属"不动主干、加计算层"路线,但 HALO 的自适应机制额外引入了推理难度感知,更适合延迟敏感场景。
InferenceLatent-ReasoningAdaptive-ComputeScaling

代码 Agent / 软件工程

11 · cs.SE cs.AI · 2607.09065
Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills
SE 历史的核心叙事是"可复用性"的演进:源代码 → 库 → 组件 → 服务 → 现在的 agent skill。本文系统分析 SE 活动如何映射为可复用的 agent skill,提出 skill market 框架——skill 作为新型可分发制品需要满足哪些封装、发现、兼容性约束。与 Tool-Making(2607.08010)互补:前者看 agent 如何自制工具,本文看工具如何形成市场生态。
Code-AgentSkill-ReuseSoftware-EngineeringAgent-Ecosystem
12 · cs.SE cs.LG · 2607.09101
Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows
单 LLM 生成单元测试遵循僵化流程,无法利用 agent 的自主推理能力。本文以人类测试工作流为蓝本设计 multi-agent 协作框架:不同 agent 分别负责需求理解、测试策略制定、用例生成、自我验证,可异步协作并相互校验。与今日代码 agent 系列形成测试维度的完整覆盖:从属性验证(2607.09072)到 bug 复现(2607.09123)再到单元测试生成。
Code-AgentMulti-AgentUnit-TestingSoftware-Engineering
13 · cs.SE cs.AI · 2607.09123
ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
Issue 报告中极少包含可执行的复现测试,开发者需花大量时间手工构造。ReProAgent 设计多阶段 agentic 管道:理解 issue → 搜索相关代码 → 调用执行工具验证 → 迭代精炼,直到复现测试稳定通过。工具调用赋予 agent 对真实运行环境的感知——是 agentic SE 中"感知-行动-验证"循环的典型实现。
Code-AgentBug-ReproductionTool-UseSoftware-Engineering

具身 / VLA

14 · cs.RO cs.LG · 2607.08877
FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space
基于 flow matching / diffusion 的生成式机器人策略在分布内表现优异,但真实部署中总会遇到分布外失败——大规模数据采集或 RL 训练的修复成本极高。FlowDAgger 提出在潜在空间中的人在环路 DAgger:专家只需在隐空间中演示少量修正轨迹,而非重新采集原始数据,大幅降低 human-in-loop 适配成本。是 flow-matching 策略与 DAgger 算法的首次结合,对低成本 VLA 在线微调有实际价值。
RoboticsDAggerFlow-MatchingHuman-in-Loop
15 · cs.AI cs.CV · 2607.09059
ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning
ARC-AGI-2 是当前最硬的 few-shot 归纳推理 benchmark,要求从少量感知输入归纳完整变换规则并合成程序。ARCANA 分解为四阶段 multi-agent 流水线:感知接地(构造对象中心场景图)→ 假设生成 → 符号执行 → 反思精炼,在严格的测试时算力和硬件约束下运行。与今日 GATS(2607.08894)和 KV-PRM(2607.09153)共同展示 multi-agent 协作在计算约束下的能力边界。
Multi-AgentProgram-SynthesisARC-AGIReasoning
数据来源:arXiv cs.AI / cs.LG / cs.CL / cs.SE / cs.RO / cs.CV — 2026-07-14 · 精选 15 篇 / 226 篇