← 首页|学术|EnvACE:用世界预演内化环境动态的Agentic强化学习
cs.AI · 2608.06197 · 提交于 2026年8月6日

EnvACE:通过世界预演将环境动态内化到Agentic强化学习中
EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo 等(含华为诺亚方舟实验室、上海交通大学相关作者,基于作者列表推断)
💬 训练长程工具调用agent通常依赖昂贵的真实/合成可执行环境或难以对齐的外部模拟器。EnvACE让策略模型同时扮演"行动者"和"环境"两个角色,通过端到端联合优化的"世界预演"把环境动态内化进模型参数本身,在BFCL-v4、τ²-Bench等四个基准上超越环境扩展类基线,测试时还能在正式执行前进行私有预演以进一步提升表现。

🎯 问题

真实/合成环境交互的构建成本高、外部模拟器难以对齐
训练面向长程工具使用的大语言模型agent,通常依赖与真实或合成的可执行环境进行交互,但这类环境的构建与验证成本高昂;另一种做法是依赖外部模拟器,但这些模拟器往往难以与真实任务语义对齐(grounded)。这两条路径都限制了agent训练在环境规模和多样性上的可扩展性。

🔬 方法

世界预演:策略模型自己扮演环境
EnvACE 用"世界预演"(world rehearsal)取代训练过程中对外部环境的真实交互。策略在"行动"和"预演"两个角色间交替:先生成一次工具调用,然后切换角色扮演"环境",生成该动作应引发的环境响应,再基于这个自己预演出的响应继续做后续决策。两个角色(行动者与环境模拟者)通过任务成功奖励进行端到端联合优化。通过这种方式,策略把"动作-环境响应"之间的关系内化进自己的参数中,相当于在模型内部形成了一个可以直接支持决策的agent世界模型。测试阶段,这个内化的世界模型还支持在正式提交动作前进行"私有预演",在适度的预演预算下无需额外的外部交互即可带来进一步的性能提升。
评测基准
在 BFCL-v4、τ²-Bench、VitaBench、FinMCP-Bench 四个基准上进行评估,并与"环境扩展"(environment-scaling)类基线方法对比。

📊 结果

整体优于环境扩展基线,跨模型规模一致有效
EnvACE 在四个基准上取得了强且可迁移的性能,整体评估中超越了以扩大真实环境交互规模为思路的基线方法。受控实验进一步表明,世界预演机制能在不同模型规模下持续提升策略学习效果;测试时利用内化世界模型进行私有预演还能在不增加外部交互的前提下带来额外增益。

💡 我的看法

这篇论文的核心洞见——让模型自己同时扮演"演员"和"环境"、通过角色内化把环境动态压缩进参数——本质上是把 world model 的学习目标和 policy 学习目标合并到同一个训练循环里,思路上和你在duplex agent方向关注的"推理与实时响应协同"有一定共鸣:两者都是在探索如何让模型在不依赖外部慢速反馈回路的情况下,对未来状态/响应做内部推演。测试时"私有预演"这个设计尤其值得关注——这与duplex agent中"在真正说出话之前先在内部完成一轮快速推演/校验"的思路是同构的,如果这种内化世界模型的预演开销足够低,理论上可以作为duplex agent在480ms时间片内做低延迟前瞻决策的一种候选机制。不过论文本身聚焦的是工具调用(tool-calling)agent训练场景,未涉及实时性/延迟约束,其"预演预算"是否能压缩到duplex交互所要求的毫秒级仍是未知数,这是该方法迁移到你的核心方向时最大的不确定性。
Agentic RLWorld ModelTool UseSelf-Play
来源: arXiv:2608.06197