← 首页|学术|Agentic Data Synthesis 精读 — 四篇论文深度解析
深度精读 · 2026-07-05

Agentic Data Synthesis
技术全景精读

四篇论文系统梳理:如何为 Agent 制造高质量训练数据——从数据分类法、多样性工程到元优化 Data Scientist

📋 4 篇论文 🧪 100+ 消融实验 (OT-Agent) 📦 100K+ 训练样本 🎯 Terminal / Code / Tool-Use / 多域
四篇论文的定位图谱

2025-2026 年间,Agentic Data Synthesis 从边缘话题成为 Agent Training 的核心基础设施。四篇论文分别从不同层面攻克这一问题。

🖥️ Terminal Agent

TMax

简单分类法大量合成高质量 Terminal 任务;9B 模型达 27% Terminal-Bench 2.0

arXiv 2606.23321 · AI2 / UW
🌐 General Agentic

OpenThoughts-Agent

100+ 消融证明任务多样性才是关键;100K 样本,7 个 benchmark 平均 44.8%

arXiv 2606.24855 · UC Berkeley / UT Austin
🤖 Meta-Level

Autodata (Meta)

训练"会生成数据的 Agent";元优化 data scientist agent 本身,推理算力→训练质量

arXiv 2606.25996 · Meta FAIR
🔗 Cross-Domain

AgentSkiller

DAG 架构 + 跨域语义融合;14 步流水线生成高保真多域工具调用数据

arXiv 2602.09372 · 更早期工作
论文 目标 核心杠杆 验证机制 数据规模 开源
TMax Terminal agent 难度控制 + Persona + 多验证器 Outcome-only RL 2.5x 最大已有集 ✅ 全栈
OT-Agent 通用 agentic 任务来源多样性(7 个领域) Outcome-based 过滤 100K 轨迹 ✅ 全栈
Autodata 通用(元层次) Meta-优化 data scientist agent 下游模型性能 未公开 ❌ Meta 内部
AgentSkiller 多域工具调用 DAG + 跨域语义融合 执行路径验证 ~11K 样本 〜 部分
arXiv 2606.23321 · Hamish Ivison, Junjie Oscar Yin et al. · AI2 / University of Washington

TMax: A Simple Recipe for Terminal Agents

Terminal-using agents 是目前最流行的 LLM 应用形态,但 RL 训练缺数据、缺基准、缺可复现 recipe。TMax 提出最强的开源 terminal agent RL 训练方案,通过新颖的数据生成分类法实现高效大规模任务合成。

27%
Terminal-Bench 2.0
(9B 参数)

核心问题:为什么 Terminal Agent 的 RL 训练落后于学术界?

Terminal agent(在真实 shell 环境中执行命令、编写脚本、操作文件系统的 agent)是目前闭源前沿模型最核心的能力之一,但学术界的研究几乎停滞。原因有三:

TMax 的目标是在这三个维度上同时建立开源基线,把学术界拉近前沿。

数据生成三元组:核心技术创新

TMax 的最重要贡献是一套 数据生成分类法,由三个维度组成:

① Difficulty Control(难度控制)

任务按难度梯度生成,而非随机采样。这实现了 隐式课程学习:模型在 RL 训练时始终面对"刚好在能力边界"的任务。太简单的任务没有 gradient signal,太难的任务 reward 稀疏——难度控制解决了这个问题,而且是以数据生成的方式解决,不需要复杂的在线课程调度。

② Personas(角色多样性)

通过定义不同"用户角色"(数据工程师、系统管理员、安全研究员、DevOps 工程师…)驱动任务生成。一个关键洞察:不需要扩展新领域,也能大幅扩展任务空间。同一个 shell 操作领域,以不同角色的视角来描述任务,自然形成指令多样性和风格多样性,降低数据同质化风险。

③ Verifier Diversification(验证器多样化)

同一任务使用多种验证方式(文件哈希 / 输出比较 / 进程状态 / 权限检查…)。这有两个效果:

关键洞察

TMax 的三元组(难度 + 角色 + 验证器)本质上是在数据生成阶段解决 RL 训练中最难的几个问题:课程调度、分布多样性、奖励鲁棒性——而不是在训练时用复杂算法去应对。

训练 Recipe:极简 Outcome-Only RL

训练方案故意保持简单:只给 outcome-level 奖励(成功/失败二值),没有过程奖励,没有复杂的 PPO 变体。结论:

可迁移的方法论

三元组框架不只适用于 terminal。难度控制 + persona + 验证器多样化可以直接迁移到任何有明确执行验证的 agentic 任务(代码 agent、工具调用 agent、GUI agent)。这是 TMax 最值得参考的地方。

⚠️ 注意:TMax 尚未提交 arXiv HTML 格式,论文图片需直接参阅 PDF 版本

arXiv 2606.24855 · 50+ 作者 · UC Berkeley / UT Austin / NYU 等

OpenThoughts-Agent: Data Recipes for Agentic Models

100+ 消融实验系统研究 agentic 数据 pipeline 的每个变量。核心发现:任务来源多样性是最关键因素,远超数量、过滤策略和模型规模。发布首个跨 7 个 benchmark 通用的开源 agentic 训练数据集。

44.8%
7个Benchmark
平均(32B)

核心问题:为什么现有工作都做不出"通用 Agent"?

现有开源 agentic 数据工作几乎都针对单一 benchmark:

这导致模型"点射"能力强、迁移能力差。OT-Agent 问的是:如何训练出在多个 agentic 任务上都表现良好的模型?

OT-Agent main results
Figure 1:OpenThoughts-Agent-SFT 在 Terminal-Bench 2.0 和 SWE-Bench Verified 上达到最强开源 ≤32B 模型性能。注意 OT-Agent 同时在两个 benchmark 上领先,而非在一个上优化牺牲另一个。

六阶段 SFT 数据 Pipeline

OT-Agent 将数据 pipeline 拆解为六个阶段,对每个阶段做独立消融:

SFT Pipeline
Figure 2:六阶段 SFT 数据 Pipeline。从任务采样(Stage 1)到合成增强(Stage 6),每个阶段独立消融。最关键的结论在 Stage 1:任务来源多样性。

最关键的消融发现:任务来源多样性 >> 一切

100+ 消融实验后,最清晰的结论是:

核心发现 #1

7 个不同领域的 agentic benchmark 混合采样任务,是所有超参数中影响最大的变量。混合来源的模型在每个单独 benchmark 上不是最好的,但跨 benchmark 平均性能最高,且随数据量 scaling 效率最高。

Sankey 图:数据流向分析

Data Pipeline Sankey
Figure 4:Sankey 数据流图。最终 100K SFT 数据集的来源分布。可以看到哪些任务源贡献了多少样本,以及过滤率如何分布在各阶段。来源多样性在这里一目了然。

Scaling 分析:合成增强 vs 上采样

Scaling comparison
Figure 3:合成增强 vs 上采样。两种方法基于同一 10K 底座,在超出底座规模后分岔。合成增强(生成新轨迹)始终优于简单上采样,且差距随规模扩大。
8B scaling curves
Figure 5:8B 模型 scaling 曲线。在 SWE-Bench Verified 和 Terminal-Bench 2.0 上,OT-Agent 数据的 scaling 斜率始终更陡——相同 token 预算获得更高性能提升。

RL 阶段:一个关键警告

OT-Agent 也研究了 RL 训练,发现了一个重要失效模式:

RL reward collapse
Figure 6:"Hero" 任务源的 RL reward 崩塌。pymethods2test 任务源在 RL 训练中奖励先上升后崩塌——模型找到了奖励 hacking 路径。单一任务源做 RL 极易出现这种情况。
RL stable reward
Figure 7:基线任务源的 RL reward 稳定上升。多样化任务源的 RL 训练 reward 单调上升,没有崩塌。这再次证明任务多样性对 RL 稳定性同样关键。
RL 训练洞察

"Hero" 现象(单一任务源 RL reward 崩塌)是一个值得警惕的信号:任务来源多样性不只影响 SFT 泛化能力,也直接影响 RL 训练的稳定性。用单一 benchmark 的任务做 RL 容易被 hack。

RL behavioral dynamics
Figure 8:"Hero" 任务的行为动态。时间分箱分析显示 reward 崩塌期间模型的输出长度、工具调用模式如何变化——可以看到模型从正常行为退化到输出捷径的全过程。
arXiv 2606.25996 · Ilia Kulikov, Weizhe Yuan, Jason Weston et al. · Meta FAIR

Autodata: An Agentic Data Scientist to Create High Quality Synthetic Data

不只是"生成数据",而是训练一个会生成数据的 Agent,然后对这个 Agent 本身做元优化。推理算力可以直接转化为训练数据质量,打通"推理 scaling → 训练 scaling"的通道。

Meta
元优化
Data Scientist

核心问题:谁来生成高质量数据?

前两篇论文的隐含假设是:人设计数据生成流水线。Autodata 问了一个更根本的问题:

Autodata 的核心问题

能不能训练一个 Agent 来充当 Data Scientist,让它自主构建高质量训练数据?然后再对这个 Data Scientist Agent 本身做优化,让它越来越擅长生成"能让下游模型变强"的数据?

三层架构

Autodata pipeline overview
Figure 1:Autodata 总体框架。三层结构:Agentic Self-Instruct(数据生成 Agent)→ Agent-as-Data-Scientist(将数据生成视为 agent 任务)→ Meta-Optimization(对 data scientist agent 本身做 RL)。每层都建立在下层之上。

第一层:Weak-vs-Strong Agentic Self-Instruct

数据生成的核心机制是 弱模型 vs 强模型对抗

Agentic Self-Instruct
Figure 2:Weak-vs-Strong Agentic Self-Instruct。主 LLM 指挥四个 Subagent:Challenger(生成挑战性问题)、Weak Solver(弱模型尝试解题)、Strong Solver(强模型解题)、Judge(评估)。只保留"弱模型失败、强模型成功"的样本——这些才是最有信息量的训练数据。

这个设计的逻辑:如果弱模型也能解决,这道题对训练没有价值(太简单);如果强模型也解决不了,无法产生正确轨迹(太难)。只有"弱失强成"的数据处于最优学习区间。

第二层:CS 研究任务的数据生成案例

CS pipeline example
Figure 4:CS 研究任务数据生成流程。以计算机科学研究问题为例,展示 Agentic Self-Instruct 如何从原始学术内容生成带评分 rubric 的训练样本——包括问题生成、解题轨迹、评估标准的完整链路。

第三层:Meta-Optimization(最关键)

这是 Autodata 最独特的贡献。Data Scientist Agent 本身可以被优化:

Meta-optimization
Figure 6:Data Scientist Agent 的元优化。进化优化框架迭代改进 data scientist 的 prompt 和策略,以下游模型的验证集表现为 reward。经过 126 次迭代,验证通过率从 62.1% 提升到 79.6%。数据质量的系统性提升。

元优化的评估循环:

  1. Data Scientist Agent 生成一批训练数据
  2. 用这批数据快速训一个小模型(代理评估)
  3. 在验证集上测量小模型的提升幅度
  4. 把这个提升作为 reward,优化 Data Scientist Agent
  5. 循环,Data Scientist 越来越会生成"让模型变强"的数据

RL 训练动态

CS RL training curves
Figure 3:CS 任务 RL 训练曲线。Train reward 和 held-out 验证集的 reward 双双上升且无发散,说明 Autodata 生成的数据支持稳健的 RL 训练。
Legal RL training
Figure 5:法律推理 RL 训练(GRPO)。Qwen3.5-4B 在 Autodata 生成的法律推理数据上 RL 训练收敛曲线。证明框架跨领域有效。
最重要的洞见:推理 Compute → 训练数据质量

Autodata 明确指出并证明了这个转化通道:给 Data Scientist Agent 更多推理算力(更多步骤、更复杂的生成流程),直接转化为训练数据质量提升,进而转化为下游模型性能。这是"inference time scaling"的另一种高价值利用方式。

arXiv 2602.09372 · 2026 年 2 月(最早期系统性工作之一)

AgentSkiller: Scaling Generalist Agent Intelligence through Semantically Integrated Cross-Domain Data Synthesis

14 步流水线合成跨域、高保真、长程多工具调用数据。DAG 架构保证确定性和可恢复性;跨域语义融合生成真实复杂任务;执行验证保证数据质量。

τ²
τ²-bench
SOTA 14B

核心问题:长程多工具数据为什么难?

AgentSkiller 面对的是最难的数据挑战:生成 跨多个领域、需要多轮工具调用、有明确状态转移 的 agent 轨迹。难在:

14 步流水线:端到端数据工程

AgentSkiller pipeline
Figure 2:AgentSkiller 端到端合成流水线。14 步分三个阶段:本体定义(步骤 1-5)、可执行实现(步骤 6-8)、任务实例化(步骤 9-17)。每步都有明确的输入输出,支持模块化替换和调试。

14 步流水线的关键创新点:

跨域语义融合:核心差异化能力

Cross-domain fusion
Figure 3:跨域语义融合机制。左:通过共享实体(Entity Fusion)将两个不同域的服务(如医疗+保险)的轨迹连接;右:Policy Harmonization 解决跨域规则冲突(如两个域对同一操作有不同约束时的协调逻辑)。

跨域融合的挑战不只是把两个域"拼起来",还要处理 Policy Harmonization(策略协调):当两个域对同一实体/操作有不同约束时,必须生成一致的解题路径,否则执行验证会失败。

数据质量分析

AgentSkiller results
Figure 1:τ-bench / τ²-bench / ACEBench-Agent 结果。AgentSkiller-14B 在 τ²-bench(跨域复合任务)上提升最显著,验证了跨域融合数据的价值。单域 benchmark 提升相对小——因为跨域数据的优势在复杂多步场景才凸显。
Tool call count accuracy
Figure 8:工具调用次数 vs 准确率。随着任务需要的工具调用次数增加,AgentSkiller-14B 的性能下降比基线慢——说明长程跨域数据确实训练出了更好的长程推理能力,不只是短任务的改进。
Tool graph case study
Figure 9:工具调用图可视化。跨域任务的工具调用图——节点是工具,边是调用依赖。可以看到跨域任务形成的图结构远比单域任务复杂,且有明确的拓扑结构(非随机图),这来自 DAG 架构的约束。
DAG 架构的关键价值

AgentSkiller 用 DAG(有向无环图)表示工具调用依赖,不只是为了"好看"——DAG 保证了 可确定性(给定任务,执行路径唯一)和 可恢复性(任何步骤失败都能精确定位并重试)。这是大规模合成数据可以做 execution-based validation 的前提。

综合分析:这个方向的深层规律

四篇论文从不同角度切入同一问题,汇聚成几个清晰的规律。

  1. 验证是第一位的基础设施

    所有四篇论文都把"如何可靠地验证 agent 轨迹"当作第一优先级。TMax 的多验证器、AgentSkiller 的 execution-based validation、OT-Agent 的 outcome-based 过滤、Autodata 的下游模型性能评估——形式不同,本质相同:没有可靠的验证信号,所有数据质量保证都是空话。这是 agentic 数据区别于普通 NLP 数据的最核心特征。

  2. 任务多样性 > 数据量(OT-Agent 最清晰地证明)

    100K 多样任务远优于 500K 同分布任务。这和 SFT 时代的教训一致,但在 agentic setting 里更极端——因为任务结构差异更大(terminal vs 代码 vs 工具调用 vs 规划),模型需要跨任务类型泛化的能力。用单一 benchmark 的任务做 RL 不只影响泛化,也影响训练稳定性(OT-Agent 的 reward collapse 现象)。

  3. 数据生成需要"结构"约束随机性

    TMax 的三元组分类法、AgentSkiller 的 DAG、Autodata 的弱-强对抗机制——都在用某种结构约束随机生成,防止数据退化为没有信息量的噪声。纯随机生成的 agentic 任务大多数要么太简单(无梯度信号),要么太难(无法产生正确轨迹)。结构化生成是解决这个问题的通用方案。

  4. SFT → RL 已成为标准流程,但边界在移动

    四篇论文都默认"先 SFT 建立行为基础,再 RL 提升上限"的 pipeline。但边界在移动:TMax 的 outcome-only RL recipe 极简;OT-Agent 在研究 SFT 和 RL 的解耦;Autodata 用 RL 训练 data scientist agent 本身。下一个问题可能是:SFT 数据到底需要多少,以及何时直接跳到 RL 更好(参考上次讨论的 SFT-RL 相关性低的问题)。

  5. 元学习是下一个前沿

    Autodata 是目前走得最深的:不只生成数据,而是训练"会生成高质量数据的 agent"。验证通过率从 62.1% → 79.6%(126 次元优化迭代)是一个强信号。未来可能不需要人工设计数据生成 pipeline,agent 自己学会什么样的数据最有价值。这和 self-play / self-improvement 的思路汇流,但 Autodata 的目标是数据质量而非任务性能,层次更高。

  6. 推理 Compute → 训练数据质量的转化通道

    Autodata 明确打通了这条路:让 data scientist agent 在推理时做更复杂的数据合成,这些高质量轨迹成为训练数据。这是 inference time scaling 的另一种利用方式——不是直接提升 benchmark 性能,而是把 inference compute 转化为训练数据质量,实现更高效的 training compute 利用。两者协同,而非替代。


研究地图:方向未来

基于四篇论文汇聚的规律,未来最值得关注的方向:

01

验证器本身的泛化

当前每类任务都需要定制验证器(文件哈希/代码执行/API 响应…)。能否训练一个通用验证器,无需任务专属工程?

02

多样性的度量与优化

OT-Agent 发现多样性是关键,但"多样性"的度量至今是 heuristic。需要更原则性的多样性度量,支持自动化任务来源选择。

03

Meta-Optimization 的 Scaling

Autodata 的元优化目前在小规模验证。Scale up 时代理评估(小模型代替全量训练)的精度是核心瓶颈。

04

SFT 数据量下限研究

结合上次精读的 SFT-RL 相关性低的发现:极少 SFT 数据 + 大量 RL 数据是否比 100K SFT 更高效?需要直接对比实验。