如何为 Agent 制造高质量训练数据?从分类法、多样性工程到元优化 Data Scientist——一个正在成熟的研究方向
Agent 需要长程、多步、可验证的训练轨迹——这和普通 SFT/RLHF 数据有本质区别。
Agent 轨迹的"好坏"无法用 ROUGE/BLEU 衡量。需要真实执行(运行代码、调用 API、操作文件系统)才能知道轨迹是否正确。
一个 20 步的任务,只有最终状态能给出 reward。中间步骤缺乏监督,随机生成的数据大多数轨迹要么太简单(无梯度),要么太难(无正确轨迹)。
针对单一 benchmark 训练的模型无法迁移。过拟合一个任务分布的代价是在所有其他任务上退化。
TMax 解决 Terminal 域的数据合成;OT-Agent 系统研究通用数据 recipe;Autodata 把数据生成本身变成可优化的 Agent;AgentSkiller 解决跨域长程工具调用数据。四者相互补充,不是竞争关系。
点击标签切换论文。每篇按「方法 → 评估设计 → 结果 vs 基线」组织。
一句话:用「难度控制 + Persona + 多验证器」三元组大量合成高质量 Terminal 任务,配合极简 Outcome-Only RL,9B 模型超过更大的闭源基线。
| Benchmark | 任务类型 |
|---|---|
| Terminal-Bench 2.0 | Shell 命令 / 脚本 / 系统管理 |
| 内部对比集 | 跨难度级别的 terminal 任务 |
| 模型 | 规模 | Terminal-Bench 2.0 |
|---|---|---|
| TMax ours | 9B | 27% |
| Prior SOTA (closed) | >9B | <27% |
| Prior open models | 各规模 | <27% |
数据集为已有最大 terminal-agent 数据集的 2.5×,完全开源(数据 + 模型 + 代码)
一句话:100+ 消融实验系统证明「任务来源多样性」是通用 agentic 模型的决定性变量;100K 样本 Qwen3-32B 在 7 个 benchmark 上平均 44.8%,超过所有此前开源方案。
| Benchmark | 任务类型 |
|---|---|
| SWE-Bench Verified | 代码 Bug 修复 |
| Terminal-Bench 2.0 | Shell 操作 |
| τ-bench | 工具调用(单域) |
| τ²-bench | 跨域工具调用 |
| ACEBench-Agent | Function Calling |
| + 2 其他 Bench | 规划 / 推理 |
| 模型 | 7-Bench 均值 |
|---|---|
| OT-Agent-32B ours | 44.8% |
| Nemotron-Terminal-32B | 40.9% |
| SWE-Smith-32B | <40% |
| Qwen3-32B (base) | — |
一句话:不只是"用 LLM 生成数据"——而是训练一个 Data Scientist Agent,然后对这个 Agent 本身做元优化(Meta-Optimization),使推理算力可以直接转化为训练数据质量。
| 领域 | 具体任务 |
|---|---|
| CS 研究 | 计算机科学研究问题问答 |
| 法律推理 | 法律条文分析 / 案例推理 |
| 数学推理 | 数学对象操作 |
| 指标 | 数值 |
|---|---|
| 元优化后验证通过率 | 79.6% |
| 元优化前基线 | 62.1% |
| 元优化迭代次数 | 126 |
| vs 经典合成数据方法 | 全面超越 |
Inference Compute → 训练数据质量 → 下游模型性能。这是 inference scaling 的另一种高价值利用方式。
一句话:用 14 步流水线(DAG 架构 + 跨域语义融合)合成跨多领域、高保真、长程多工具调用的 agent 训练数据,解决"真实复杂任务无法直接获取"的核心障碍。
| Benchmark | 特点 |
|---|---|
| τ²-bench | 跨域工具调用(核心) |
| τ-bench | 单域工具调用 |
| ACEBench-Agent | Function Calling |
四篇论文评估的 benchmark 不完全重叠——这里整合所有可见的对比数据。
| 论文 | 目标任务 | 主要基线被谁超越 | 最强数字 | 开源 |
|---|---|---|---|---|
| TMax | Terminal Agent | Prior open + closed (larger) | 27% Terminal-B 2.0 @9B | 全栈 |
| OT-Agent | 通用 Agentic | Nemotron-Terminal-32B (40.9%) | 44.8% 7-Bench avg @32B | 全栈 |
| Autodata | CS/法律/数学推理 | Classical synthetic data methods | 62.1%→79.6% 元优化 | 未开源 |
| AgentSkiller | 跨域工具调用 | 同规模 14B 基线 | τ²-bench SOTA @14B | 部分 |
| SWE-Smith | 单一: SWE-Bench | — | SWE Bench 强,其余弱 | 开源 |
| Nemotron-Terminal | 单一: Terminal | — | 40.9% 7-Bench @32B | 开源 |
四篇论文不在同一赛道上竞争:TMax / OT-Agent / AgentSkiller 的目标是「让训练出的 agent 在 benchmark 上更强」;Autodata 的目标是「让数据生成过程本身更好」。后者的 metric 是数据质量,而非 benchmark 排名。
| 模型 | 来源 | 规模 | Terminal-Bench 2.0 |
|---|---|---|---|
| TMax | AI2 / UW | 9B | 27% |
| OT-Agent (SFT) | Berkeley et al. | 32B | ~最强 |
| Nemotron-Terminal | NVIDIA | 32B | 低于 OT-Agent |
| Prior open models | various | >9B | <27% |
| 模型 | 数据来源 | 7-Bench 均值 | 相对提升 |
|---|---|---|---|
| OT-Agent-32B | 7域混合 100K | 44.8% | +3.9pp |
| Nemotron-Terminal-32B | Terminal 单域 | 40.9% | baseline |
| SWE-Smith-32B | Code 单域 | <40% | — |
| 维度 | TMax | OT-Agent | Autodata | AgentSkiller |
|---|---|---|---|---|
| 数据生成策略 | 分类法(难度+Persona+验证器) | 多域采样 + 合成增强 | 弱-强对抗 + 元优化 | DAG + 跨域语义融合 |
| 验证机制 | 多验证器(文件/输出/状态) | Outcome-based 过滤 | 下游模型性能 | 执行路径验证 |
| 训练方式 | SFT + Outcome RL | SFT(可接 RL) | SFT + 元 RL | SFT |
| 多样性来源 | Persona 角色多样 | 7 个 benchmark 域 | 跨任务领域 | 跨域融合 + 本体图 |
| 规模 | 2.5× 已有最大集 | 100K 轨迹 | 未公开 | ~11K 样本 |
| 可复现性 | 完全开源 | 完全开源 | 未开源 | 部分 |
四篇论文从不同角度切入,汇聚成以下清晰规律。
所有四篇都把"如何可靠验证 agent 轨迹"放在最高优先级。没有可靠验证信号,RL reward 是噪声,过滤是无效的。Agentic 数据区别于普通 NLP 数据的最核心特征:可执行验证。
单一来源 500K 不如多域 100K。这在 agentic setting 里比 SFT 时代更极端——任务结构差异更大,跨类型泛化能力更难习得。多样性同时影响 SFT 泛化和 RL 训练稳定性。
TMax 的三元组分类法、AgentSkiller 的 DAG、Autodata 的弱-强对抗——都在用"结构"约束随机生成。纯随机生成的 agentic 任务要么太简单(无梯度),要么太难(无正确轨迹)。
四篇默认先 SFT 建行为基础,再 RL 提上限。但结合「SFT 分数和 RL 性能相关性低(R²=0.43)」的发现:极少 SFT + 大量高质量 RL 数据是否比 100K SFT 更高效? 需要直接对比实验。
不只是生成数据,而是训练"会生成高质量数据的 Agent"。验证通过率 62.1%→79.6% 是强信号。未来可能不需要人工设计 pipeline,Agent 自己学会什么数据最有价值。
Autodata 明确验证:给 Data Scientist Agent 更多推理算力 → 更高质量轨迹 → 下游模型更强。这是 Inference Scaling 的另一种高价值利用:不是直接提 benchmark,而是把 inference compute 转化为 training compute 的效率提升。
以下是这个方向目前最值得做的后续研究——直接在对话里告诉我你感兴趣的,我们可以深入展开。
当前每类任务需定制验证器。能否训练一个跨任务通用验证器?
SFT 数据量下限研究——多少 SFT 数据配合多少 RL 数据最高效?
OT-Agent 发现多样性是关键,但没有原则性度量。自动化任务来源选择?
Autodata 元优化在小规模验证。Scale up 时代理评估精度是核心瓶颈。