← 首页|学术|EvoHarness-RL:为长程LLM Agent学习自演化运行时harness
cs.LG · cs.CL · 2608.05446 · 提交于 2026年8月5日

EvoHarness-RL:为长程LLM Agent学习可自演化的运行时Harness策略
EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng 等(含Meta/伊利诺伊大学厄巴纳-香槟分校相关作者,基于作者列表推断)
💬 长程agent依赖外部harness(运行时支架)来维护状态、追踪进度、调用工具,但这套外部工作区通常靠prompt和人工规则手搓。EvoHarness-RL把Belief/Progress/Experience三类外部状态本身变成可学习的策略对象,用监督微调+成本感知GRPO训练agent学会何时读写这些状态,在ALFWorld上用Qwen3-8B取得96.9%成功率,并观察到训练会让agent从"频繁调用harness"演化为"选择性访问"。

🎯 问题

外部harness的构建与使用策略仍是人工工程
长程LLM agent越来越依赖外部执行支持(harness)来维护状态、追踪进度、调用工具、验证结果,并在多次交互间复用经验。但有效使用harness面临两个耦合的挑战:一是如何从嘈杂的交互轨迹中形成有用的状态表示(state formation),二是如何在运行时控制对外部状态的访问(runtime control)。现有agent通常靠prompt、启发式规则或领域特定的约定来同时处理这两个问题,导致外部工作区本身及其使用策略都依赖人工设计,缺乏可学习、可泛化的机制。

🔬 方法

Belief / Progress / Experience 三类可学习的harness状态
论文将这一问题形式化为"harness策略学习"(harness policy learning):agent离线学习harness使用策略,并在运行时任务执行过程中在线部署这些策略去构建和更新外部harness状态。EvoHarness-RL 将 Belief(信念)、Progress(进度)、Experience(经验)三类状态暴露为面向策略的harness state。训练分两步:先用监督式harness微调,教会基础agent harness的动作空间以及如何构建有用的外部状态;再用"成本感知的GRPO"(cost-aware GRPO)探索协调策略,学习在长程交互中如何选择性地读取、更新和整合(consolidate)这些状态。
实例化于 ALFWorld + Qwen3-8B
在 ALFWorld 环境上用 Qwen3-8B 模型实例化该方法进行验证。

📊 结果

96.9% 成功率,并观察到两种训练动态
EvoHarness-RL 在 ALFWorld 上达到 96.9% 的成功率,并揭示了两个关键动态:一是"harness退火"(harness annealing)——训练过程将反复出现的harness使用模式内化进模型策略本身,使agent从频繁调用harness逐渐转向对外部状态的选择性访问;二是"harness演化"(harness evolution)——进度更新与经验整合机制不断精炼harness,使其收敛为一个紧凑的、随任务自适应的状态基底(state substrate)。

💡 我的看法

"harness annealing"这个发现挺有意思:训练让模型逐渐把"该不该查/更新外部状态"这件事内化为策略的一部分,而不是每步都机械调用,这本质上是一种学出来的"何时该主动获取额外信息、何时该直接依赖内部状态推进"的决策能力。这与duplex agent中的turn-taking决策有一定的结构类比——duplex agent同样需要学会"何时该主动打断/响应、何时该继续沉默倾听",而不是靠固定规则触发;如果把"harness访问"替换成"是否发起一次交互动作",EvoHarness-RL这种"用RL学出选择性访问模式,而非依赖prompt硬编码规则"的思路,对训练duplex agent的Interaction Layer何时与Thinking Layer交互,可能有一定的方法论参考价值。不过这篇论文的实验场景(ALFWorld,单agent、回合制的具身任务)与duplex agent面对的实时、并发、低延迟约束的语音交互场景差异较大,harness的"读写"操作在实时场景下能否保持轻量、不引入额外延迟,是迁移时需要重新评估的关键问题。总体而言,这是一篇把"agent的外部状态管理"本身变成可学习对象的扎实工作,思路具有一定的普适性。
Agent HarnessLong-Horizon AgentAgentic RLState Management
来源: arXiv:2608.05446