四篇论文系统梳理:如何为 Agent 制造高质量训练数据——从数据分类法、多样性工程到元优化 Data Scientist
2025-2026 年间,Agentic Data Synthesis 从边缘话题成为 Agent Training 的核心基础设施。四篇论文分别从不同层面攻克这一问题。
简单分类法大量合成高质量 Terminal 任务;9B 模型达 27% Terminal-Bench 2.0
100+ 消融证明任务多样性才是关键;100K 样本,7 个 benchmark 平均 44.8%
训练"会生成数据的 Agent";元优化 data scientist agent 本身,推理算力→训练质量
DAG 架构 + 跨域语义融合;14 步流水线生成高保真多域工具调用数据
| 论文 | 目标 | 核心杠杆 | 验证机制 | 数据规模 | 开源 |
|---|---|---|---|---|---|
| TMax | Terminal agent | 难度控制 + Persona + 多验证器 | Outcome-only RL | 2.5x 最大已有集 | ✅ 全栈 |
| OT-Agent | 通用 agentic | 任务来源多样性(7 个领域) | Outcome-based 过滤 | 100K 轨迹 | ✅ 全栈 |
| Autodata | 通用(元层次) | Meta-优化 data scientist agent | 下游模型性能 | 未公开 | ❌ Meta 内部 |
| AgentSkiller | 多域工具调用 | DAG + 跨域语义融合 | 执行路径验证 | ~11K 样本 | 〜 部分 |
Terminal-using agents 是目前最流行的 LLM 应用形态,但 RL 训练缺数据、缺基准、缺可复现 recipe。TMax 提出最强的开源 terminal agent RL 训练方案,通过新颖的数据生成分类法实现高效大规模任务合成。
Terminal agent(在真实 shell 环境中执行命令、编写脚本、操作文件系统的 agent)是目前闭源前沿模型最核心的能力之一,但学术界的研究几乎停滞。原因有三:
TMax 的目标是在这三个维度上同时建立开源基线,把学术界拉近前沿。
TMax 的最重要贡献是一套 数据生成分类法,由三个维度组成:
任务按难度梯度生成,而非随机采样。这实现了 隐式课程学习:模型在 RL 训练时始终面对"刚好在能力边界"的任务。太简单的任务没有 gradient signal,太难的任务 reward 稀疏——难度控制解决了这个问题,而且是以数据生成的方式解决,不需要复杂的在线课程调度。
通过定义不同"用户角色"(数据工程师、系统管理员、安全研究员、DevOps 工程师…)驱动任务生成。一个关键洞察:不需要扩展新领域,也能大幅扩展任务空间。同一个 shell 操作领域,以不同角色的视角来描述任务,自然形成指令多样性和风格多样性,降低数据同质化风险。
同一任务使用多种验证方式(文件哈希 / 输出比较 / 进程状态 / 权限检查…)。这有两个效果:
TMax 的三元组(难度 + 角色 + 验证器)本质上是在数据生成阶段解决 RL 训练中最难的几个问题:课程调度、分布多样性、奖励鲁棒性——而不是在训练时用复杂算法去应对。
训练方案故意保持简单:只给 outcome-level 奖励(成功/失败二值),没有过程奖励,没有复杂的 PPO 变体。结论:
三元组框架不只适用于 terminal。难度控制 + persona + 验证器多样化可以直接迁移到任何有明确执行验证的 agentic 任务(代码 agent、工具调用 agent、GUI agent)。这是 TMax 最值得参考的地方。
⚠️ 注意:TMax 尚未提交 arXiv HTML 格式,论文图片需直接参阅 PDF 版本。
100+ 消融实验系统研究 agentic 数据 pipeline 的每个变量。核心发现:任务来源多样性是最关键因素,远超数量、过滤策略和模型规模。发布首个跨 7 个 benchmark 通用的开源 agentic 训练数据集。
现有开源 agentic 数据工作几乎都针对单一 benchmark:
这导致模型"点射"能力强、迁移能力差。OT-Agent 问的是:如何训练出在多个 agentic 任务上都表现良好的模型?
OT-Agent 将数据 pipeline 拆解为六个阶段,对每个阶段做独立消融:
100+ 消融实验后,最清晰的结论是:
从 7 个不同领域的 agentic benchmark 混合采样任务,是所有超参数中影响最大的变量。混合来源的模型在每个单独 benchmark 上不是最好的,但跨 benchmark 平均性能最高,且随数据量 scaling 效率最高。
OT-Agent 也研究了 RL 训练,发现了一个重要失效模式:
"Hero" 现象(单一任务源 RL reward 崩塌)是一个值得警惕的信号:任务来源多样性不只影响 SFT 泛化能力,也直接影响 RL 训练的稳定性。用单一 benchmark 的任务做 RL 容易被 hack。
不只是"生成数据",而是训练一个会生成数据的 Agent,然后对这个 Agent 本身做元优化。推理算力可以直接转化为训练数据质量,打通"推理 scaling → 训练 scaling"的通道。
前两篇论文的隐含假设是:人设计数据生成流水线。Autodata 问了一个更根本的问题:
能不能训练一个 Agent 来充当 Data Scientist,让它自主构建高质量训练数据?然后再对这个 Data Scientist Agent 本身做优化,让它越来越擅长生成"能让下游模型变强"的数据?
数据生成的核心机制是 弱模型 vs 强模型对抗:
这个设计的逻辑:如果弱模型也能解决,这道题对训练没有价值(太简单);如果强模型也解决不了,无法产生正确轨迹(太难)。只有"弱失强成"的数据处于最优学习区间。
这是 Autodata 最独特的贡献。Data Scientist Agent 本身可以被优化:
元优化的评估循环:
Autodata 明确指出并证明了这个转化通道:给 Data Scientist Agent 更多推理算力(更多步骤、更复杂的生成流程),直接转化为训练数据质量提升,进而转化为下游模型性能。这是"inference time scaling"的另一种高价值利用方式。
14 步流水线合成跨域、高保真、长程多工具调用数据。DAG 架构保证确定性和可恢复性;跨域语义融合生成真实复杂任务;执行验证保证数据质量。
AgentSkiller 面对的是最难的数据挑战:生成 跨多个领域、需要多轮工具调用、有明确状态转移 的 agent 轨迹。难在:
14 步流水线的关键创新点:
跨域融合的挑战不只是把两个域"拼起来",还要处理 Policy Harmonization(策略协调):当两个域对同一实体/操作有不同约束时,必须生成一致的解题路径,否则执行验证会失败。
AgentSkiller 用 DAG(有向无环图)表示工具调用依赖,不只是为了"好看"——DAG 保证了 可确定性(给定任务,执行路径唯一)和 可恢复性(任何步骤失败都能精确定位并重试)。这是大规模合成数据可以做 execution-based validation 的前提。
四篇论文从不同角度切入同一问题,汇聚成几个清晰的规律。
所有四篇论文都把"如何可靠地验证 agent 轨迹"当作第一优先级。TMax 的多验证器、AgentSkiller 的 execution-based validation、OT-Agent 的 outcome-based 过滤、Autodata 的下游模型性能评估——形式不同,本质相同:没有可靠的验证信号,所有数据质量保证都是空话。这是 agentic 数据区别于普通 NLP 数据的最核心特征。
100K 多样任务远优于 500K 同分布任务。这和 SFT 时代的教训一致,但在 agentic setting 里更极端——因为任务结构差异更大(terminal vs 代码 vs 工具调用 vs 规划),模型需要跨任务类型泛化的能力。用单一 benchmark 的任务做 RL 不只影响泛化,也影响训练稳定性(OT-Agent 的 reward collapse 现象)。
TMax 的三元组分类法、AgentSkiller 的 DAG、Autodata 的弱-强对抗机制——都在用某种结构约束随机生成,防止数据退化为没有信息量的噪声。纯随机生成的 agentic 任务大多数要么太简单(无梯度信号),要么太难(无法产生正确轨迹)。结构化生成是解决这个问题的通用方案。
四篇论文都默认"先 SFT 建立行为基础,再 RL 提升上限"的 pipeline。但边界在移动:TMax 的 outcome-only RL recipe 极简;OT-Agent 在研究 SFT 和 RL 的解耦;Autodata 用 RL 训练 data scientist agent 本身。下一个问题可能是:SFT 数据到底需要多少,以及何时直接跳到 RL 更好(参考上次讨论的 SFT-RL 相关性低的问题)。
Autodata 是目前走得最深的:不只生成数据,而是训练"会生成高质量数据的 agent"。验证通过率从 62.1% → 79.6%(126 次元优化迭代)是一个强信号。未来可能不需要人工设计数据生成 pipeline,agent 自己学会什么样的数据最有价值。这和 self-play / self-improvement 的思路汇流,但 Autodata 的目标是数据质量而非任务性能,层次更高。
Autodata 明确打通了这条路:让 data scientist agent 在推理时做更复杂的数据合成,这些高质量轨迹成为训练数据。这是 inference time scaling 的另一种利用方式——不是直接提升 benchmark 性能,而是把 inference compute 转化为训练数据质量,实现更高效的 training compute 利用。两者协同,而非替代。
基于四篇论文汇聚的规律,未来最值得关注的方向:
当前每类任务都需要定制验证器(文件哈希/代码执行/API 响应…)。能否训练一个通用验证器,无需任务专属工程?
OT-Agent 发现多样性是关键,但"多样性"的度量至今是 heuristic。需要更原则性的多样性度量,支持自动化任务来源选择。
Autodata 的元优化目前在小规模验证。Scale up 时代理评估(小模型代替全量训练)的精度是核心瓶颈。
结合上次精读的 SFT-RL 相关性低的发现:极少 SFT 数据 + 大量 RL 数据是否比 100K SFT 更高效?需要直接对比实验。