← 首页|学术|AgentMercury: 从商业场景规模化合成可验证 Agent 环境
cs.CL · cs.AI · 2608.20634 · 21 Aug 2026

AgentMercury: Agent 自主合成商业场景的可验证环境,规模化训练

Minbyul Jeong, Chanwoong Yoon
💬 传统 agent 训练环境是围绕预定义任务手工搭建的,很难随真实世界的多样性扩展。AgentMercury 反过来做:先合成一个包含实体、服务、工具、状态和跨服务不变量的持久化世界,再让任务和交互轨迹从这个世界中自然涌现——而且"造世界"这件事本身也可以被学会。

🎯 问题

Task-centric 范式的扩展瓶颈
主流做法是为每个基准任务单独构造一个环境:先定好任务,再倒推出满足任务要求的最小环境。这种方式产出的环境天然是"为考试而生"的,覆盖不了真实企业工作流里那些没有被预先设计过的、自然涌现的任务组合,也难以规模化——每加一类任务就要重新设计一遍环境。
AgentMercury 的核心翻转:不为任务造环境,而是先造一个可执行、有状态的"世界",任务是这个世界的副产品,不是它的起点。

🔬 方法

持久化世界:实体 · 服务 · 工具 · 状态 · 跨服务不变量
给定一个高层商业场景描述(例如某个行业/国家的典型业务流程),框架先实例化一个持久化世界,包含:具体的业务实体(客户、订单、库存等)、可调用的服务与工具、随时间演化的状态,以及跨多个服务之间必须保持一致的可执行不变量(invariant)——这些不变量本身可以被程序验证,保证环境是"可验证的",而不只是看起来合理的模拟。多样的任务与交互轨迹之后从这个持久世界中自然生成。
为什么强调"可执行"和"可验证":如果环境只是文本描述的世界观,agent 的动作无法被真正判定对错,训练信号就是噪声。AgentMercury 要求世界的状态转移和跨服务约束是程序可执行、可检验的,这样 RL 训练时的 reward 才有地基。
规模化产出:4,783 个环境 · 14 个行业 · 50 个国家
用这套流程批量合成了近五千个覆盖广泛行业和地区差异(不同国家的业务规则、合规要求等)的可执行环境,作为强化学习的训练底座(training substrate)。
把"造环境"本身变成一种可学习的能力
论文进一步验证:环境构造过程不必永远依赖人工设计的生成流程——可以用已有的构造轨迹(construction traces)去微调一个模型,让它自己学会写出可执行的商业世界。
▶ 技术细节
在 Qwen3.5-35B-A3B 上用构造轨迹做微调后,模型在留出(held-out)的新商业场景上,独立生成可执行世界的成功率从 3.3% 大幅提升到 83.3%。这说明环境合成的知识是可以从少量示范中泛化的,而不是每个场景都要靠专家规则硬编码。

📊 结果

EnterpriseOps-GYM
12.3 → 15.7
Qwen3.5-4B,企业场景内评测
AIME26(域外)
45.9 → 56.0
未针对该基准训练
世界构造成功率
3.3% → 83.3%
Qwen3.5-35B-A3B,留出场景
最值得注意的是 AIME26(数学推理)这类与商业场景完全无关的域外基准也出现了大幅提升,论文将其归因于训练信号并非任务特异性的死记硬背,而是来自在一个真正复杂、有状态、多约束的世界中反复交互所习得的通用能力——推理、编码、科学计算、工具使用等维度都观察到了泛化收益。
数据均引自 arXiv 摘要页,全文实验细节(消融、基准设置)需查阅 PDF/HTML 全文,本页未展开解析

💡 与 Agent Environment 方向的关联

这篇论文直接落在"环境即训练底座"这条路线上:与其为每个 benchmark 精雕细琢一个环境,不如先把"世界"这一层做对——持久状态、跨服务不变量、可执行验证——任务自然从世界中涌现。这与近期 agent 训练圈子里"world model as substrate"的思路呼应,也呼应了 duplex/多智能体场景下需要长期一致状态的交互设定:一个能持久维护状态、支持多轮跨服务调用并可程序验证的环境,本身就是训练更强 agent(乃至未来全双工/多轮实时交互 agent)所需要的基础设施。"造环境的能力可以被学会"这一发现如果成立,意味着环境合成本身可能变成 agent 训练流水线里可自动化的一环,而不是永远的人力瓶颈。
Agent EnvironmentSynthetic DataReinforcement LearningEnterprise Agent
来源:arXiv:2608.20634(摘要页 + HTML/元数据),未解析 PDF 全文,图表与消融细节以原文为准。