← 首页|学术|ArXiv 日报 — 2026-07-14
学术 · 2026年7月14日
ArXiv 日报
SLM Harness · KV-PRM · Sticky MoE · Chat-to-Agent Steering
你的领域 5篇
RL / 训练 3篇
推理基础设施 2篇
代码Agent / SE 3篇
具身 / VLA 2篇
今日亮点:SLM agent 90% 成本降低(2607.08938)通过自动 harness 适配让小模型匹配大模型性能,是 harness 工程三连击的最后一块;KV-PRM(2607.09153)首次将 KV-Cache 复用嫁接到 PRM 评分,解决 multi-agent TTS 场景下评分成本二次增长问题;Sticky Routing(2607.08780)从训练侧解决 MoE 边缘推理的 expert 切换开销;Chat-to-Agent Activation Steering(2607.09156)发现方向向量在 agent 场景"Present but Rescaled",为 agent 可操控性研究提供首个迁移基准。
你的领域:Agent 架构 · Agentic RL · 评估
1 · cs.AI cs.CL · 2607.08938
前沿 LLM agent 的推理成本使大规模部署不可持续,但将 SLM 直接替换进为大模型设计的 harness 里效果会大幅下降。本文证明对于大量常规业务任务,SLM agent 可以通过自动 harness 适配(调整工具调用时机、上下文截断策略、失败恢复逻辑)匹配 LLM 性能,同时降低 90% 推理成本。与 Harness Effect(2607.06906)、From Prompts to Contracts(2607.08028)构成 harness 工程三连击,这篇锁定"降成本+小模型"角度。
HarnessSLMCost-ReductionEnterprise-AI
2 · cs.LG cs.AI · 2607.09153
Process Reward Model 引导 test-time scaling 效果显著,但现有 PRM 每次打分都从头编码完整轨迹——在多 agent 长 rollout 场景下成本随轨迹长度呈二次增长。KV-PRM 利用 KV-Cache 转移:把上一步的 KV 状态直接传递给下一步的 PRM 评分,避免重复计算。PRM + 推理效率的直接结合,对 multi-agent TTS 工程有实际影响。
Process-RewardKV-CacheTest-Time-ScalingAgentic-RL
3 · cs.AI · 2607.08964
现有终端 benchmark 主要关注"几分钟内能完成的简短任务"且仅评估最终结果——稀疏奖励下 agent 表现被严重低估。Long-Horizon-Terminal-Bench 引入密集奖励评分(dense reward-based grading),追踪中间进度和部分解,能区分"差一点就做到了"和"完全没有方向"的两种失败。与 DeepSWE(2607.07946)共同推进长时域 agent 评估精细化。
BenchmarkLong-HorizonDense-RewardEvaluation
4 · cs.AI cs.LG · 2607.08894
LATS/ReAct 类方法在规划中重度依赖 LLM 推理,计算成本高且行为随机。GATS 用分层 World Model + 图增强树搜索替代每步的 LLM 推理——高层约束全局方向,低层评估局部动作,图结构跨轨迹复用已有计划节点。实质是把 agent 规划的"反复推理"成本转移到 World Model,与今日 KV-PRM 的 KV-Cache 复用构成计算效率的两条平行路线。
Agent-PlanningWorld-ModelTree-SearchEfficiency
5 · cs.AI cs.CL · 2607.08774
可靠性通常被当作模型能力的函数,但本文论证可靠性的关键在于推理时控制层——决定任务如何被框架化、哪些上下文被选入、何时终止。CogniConsole 将 inference-time control 形式化为独立于模型的抽象层,使控制逻辑可审计、可测试、可替换,不需要修改模型本身。是 harness 工程化思路的理论化版本,为 agent 可靠性研究提供了新的分析切口。
ReliabilityInference-ControlAgent-ArchitectureFormal-Abstraction
RL / 训练
6 · cs.LG cs.RO · 2607.09042
VLA 模型的 RL 后训练面临严重的样本效率问题:早期策略几乎每次 rollout 都失败,稀疏奖励下几乎没有可学习的正向信号。本文提出 RL from Hindsight:从失败轨迹中回溯构造 reward——把"失败的完整尝试"拆解为"某一步骤局部成功"的后验标注,为空奖励轨迹提供密集监督信号。专为机械臂 VLA 设计,但方法原理对 agentic RL 冷启动问题普适适用。
Agentic-RLHindsightSample-EfficiencyVLA
7 · cs.CL cs.LG · 2607.09156
Activation steering 在单轮 chat 场景已被广泛研究,但同一方向向量迁移到工具调用 ReAct agent 上效果如何?本文首个系统研究 chat→agent 的 steering 迁移,发现方向本身在 agent 场景仍然存在,但需要重新标定缩放系数——chat 标定的幅度迁移到 agent 后通常过大或过小。为 activation engineering 在 agentic 场景的应用提供了基础校准数据。
Activation-SteeringChat-to-AgentInterpretabilityTool-Use
8 · cs.LG cs.AI · 2607.09053
近期报道了"Emergent Misalignment"——特定领域微调后模型涌现出广泛的不对齐行为,且可通过少量重对齐数据逆转。本文系统复现该实验,对不同模型家族重复对齐/反对齐循环,发现该现象稳健性远低于原文报告:部分家族根本不涌现,且重复循环后行为高度不稳定。为"某种特殊训练会让模型全局变坏/变好"的叙事提供了严重质疑。
AlignmentEmergent-MisalignmentRobustnessFine-Tuning
推理基础设施
9 · cs.LG cs.CL · 2607.08775
如何在不修改预训练 LLM 主干的前提下提升能力?HALO 在 backbone 隐状态顶部加入自适应轻量 refinement head:根据任务难度动态决定是单步 refinement(快)还是多步(强),在计算预算与质量之间取得更优权衡。与 Hidden Decoding(2607.08186)同属"不动主干、加计算层"路线,但 HALO 的自适应机制额外引入了推理难度感知,更适合延迟敏感场景。
InferenceLatent-ReasoningAdaptive-ComputeScaling
10 · cs.LG cs.AR · 2607.08780
MoE 模型在边缘设备推理时,连续 token 频繁激活不同 expert,导致权重在慢速存储和快速内存间不断换入换出——显著增加延迟。现有修复方案是事后的(路由器微调)或系统层的(缓存启发式),本文从训练阶段解决:在训练目标中加入 Sticky Routing 正则化,鼓励相邻 token 倾向激活相同 expert。对边缘端 MoE serving 有直接的延迟降低效果,与全双工 agent 的低延迟诉求吻合。
MoEInferenceMemory-EfficiencyEdge-Deployment
代码 Agent / 软件工程
11 · cs.SE cs.AI · 2607.09065
SE 历史的核心叙事是"可复用性"的演进:源代码 → 库 → 组件 → 服务 → 现在的 agent skill。本文系统分析 SE 活动如何映射为可复用的 agent skill,提出 skill market 框架——skill 作为新型可分发制品需要满足哪些封装、发现、兼容性约束。与 Tool-Making(2607.08010)互补:前者看 agent 如何自制工具,本文看工具如何形成市场生态。
Code-AgentSkill-ReuseSoftware-EngineeringAgent-Ecosystem
12 · cs.SE cs.LG · 2607.09101
单 LLM 生成单元测试遵循僵化流程,无法利用 agent 的自主推理能力。本文以人类测试工作流为蓝本设计 multi-agent 协作框架:不同 agent 分别负责需求理解、测试策略制定、用例生成、自我验证,可异步协作并相互校验。与今日代码 agent 系列形成测试维度的完整覆盖:从属性验证(2607.09072)到 bug 复现(2607.09123)再到单元测试生成。
Code-AgentMulti-AgentUnit-TestingSoftware-Engineering
13 · cs.SE cs.AI · 2607.09123
Issue 报告中极少包含可执行的复现测试,开发者需花大量时间手工构造。ReProAgent 设计多阶段 agentic 管道:理解 issue → 搜索相关代码 → 调用执行工具验证 → 迭代精炼,直到复现测试稳定通过。工具调用赋予 agent 对真实运行环境的感知——是 agentic SE 中"感知-行动-验证"循环的典型实现。
Code-AgentBug-ReproductionTool-UseSoftware-Engineering
具身 / VLA
14 · cs.RO cs.LG · 2607.08877
基于 flow matching / diffusion 的生成式机器人策略在分布内表现优异,但真实部署中总会遇到分布外失败——大规模数据采集或 RL 训练的修复成本极高。FlowDAgger 提出在潜在空间中的人在环路 DAgger:专家只需在隐空间中演示少量修正轨迹,而非重新采集原始数据,大幅降低 human-in-loop 适配成本。是 flow-matching 策略与 DAgger 算法的首次结合,对低成本 VLA 在线微调有实际价值。
RoboticsDAggerFlow-MatchingHuman-in-Loop
15 · cs.AI cs.CV · 2607.09059
ARC-AGI-2 是当前最硬的 few-shot 归纳推理 benchmark,要求从少量感知输入归纳完整变换规则并合成程序。ARCANA 分解为四阶段 multi-agent 流水线:感知接地(构造对象中心场景图)→ 假设生成 → 符号执行 → 反思精炼,在严格的测试时算力和硬件约束下运行。与今日 GATS(2607.08894)和 KV-PRM(2607.09153)共同展示 multi-agent 协作在计算约束下的能力边界。
Multi-AgentProgram-SynthesisARC-AGIReasoning
数据来源:arXiv cs.AI / cs.LG / cs.CL / cs.SE / cs.RO / cs.CV — 2026-07-14 · 精选 15 篇 / 226 篇