← 首页|学术|ASTER: Agentic Scaling with Tool-integrated Extended Reasoning
cs.AI cs.LG · 2602.01204 · Feb 2026

ASTER: Agentic Scaling with Tool-integrated Extended Reasoning

Xuqin Zhang, Quan He, Zhenrui Zheng, Zongzhang Zhang, Xu He, Dong Li — Huawei / Nanjing University
Agentic RL Tool-Integrated Reasoning Interaction Collapse Cold Start GRPO
核心结论:Tool-Integrated Reasoning 的 RL 扩展存在交互崩溃(interaction collapse)缺陷——模型学会用长内部推理替代多步工具调用,因为这样"省力"。解决方案不是更多数据,而是用≥9次工具调用的高密度 SFT(仅4K条)冷启动 RL,保持训练 entropy 高位,防止过早收敛。ASTER-4B 在 AIME2024 达到 85.8%,超过 Qwen3-235B(85.7%)。

🎯 问题:交互崩溃

什么是 Interaction Collapse
Tool-Integrated Reasoning(TIR)是指模型在推理过程中交错调用工具(如 Python 解释器),利用工具的精确计算来增强推理——这是数学解题 agent 的核心能力之一。

在 RL 训练过程中,模型发现了一条捷径:只用少量工具调用 + 大量内部文字推理,同样可以拿到奖励。随着训练进行,工具调用次数逐渐减少,模型最终退化为"普通思考链",失去了多步工具交互的能力。
为什么会发生:从 RL 的角度看,工具调用有成本(token 消耗、执行延迟、可能出错),但内部推理"免费"。如果模型通过更长的内部推理也能得到正确答案,它会学习走这条更省力的路——即使放弃了工具带来的精确性优势。这是 reward shaping 不完善 + policy 贪心优化共同导致的退化。
现有冷启动方案(ReTool、DemyAgent)的 SFT 数据中,每条轨迹平均工具调用次数太少(≤5次甚至≤1次)——以这样的数据冷启动,模型从一开始就没有"密集工具交互"的行为先验,RL 进一步强化了这个方向。

🔬 方法:ASTER 两阶段管道

阶段一:交互密集型冷启动 SFT
从 45K 条总轨迹中,精选出≥9次工具调用的 4K 条作为冷启动数据。关键取舍:
直觉:冷启动 SFT 的目标不是"让模型答对题",而是"让模型进入一个行为丰富、策略多样的初始状态"。这样的初始状态让后续 RL 有足够的行为空间去探索和优化,而不是从一开始就被锁定在少量工具调用的局部最优里。
阶段二:多阶段 GRPO RL
在冷启动后的模型上,用 GRPO 进行 RL 训练:
▶ 训练配置细节
Base models:Qwen3-1.7B-Thinking,Qwen3-4B-Thinking-2507
RL 算法:GRPO,每个 prompt 采样 G=8 条轨迹,batch size=128
Tool sandbox:Python 解释器,允许最多 50 次调用/轨迹
总数据:45K 轨迹;冷启动用 4K 高交互子集(≥9 calls)
Clip-Higher:positive advantage 的 clip 阈值 ε_h=0.28(vs. 标准 GRPO 的 ε=0.2)
上下文预算:Phase 1 = 18K tokens,Phase 2 = 32K tokens

📊 主要结果

AIME2024
85.8%
ASTER-4B (90K)
AIME2025
90.0%
ASTER-4B (90K)
HMMT2025
77.1%
vs 62.5% (235B)
BeyondAIME
61.7%
ASTER-4B (90K)
模型AIME2024AIME2025HMMT2025BeyondAIME
ASTER-4B (90K budget)85.8%90.0%77.1%61.7%
ASTER-4B (30K budget)82.3%85.0%73.3%53.9%
Qwen3-235B-A22B-Thinking85.7%81.5%62.5%
rStar2-Agent-14B80.6%69.8%52.7%
ASTER-1.7B (90K budget)72.5%76.7%60.0%

💡 三个核心研究问题的答案

RQ1:什么样的冷启动数据能防止 interaction collapse?
稀疏交互 SFT(≤5次调用)→ 触发 collapse。密集交互 SFT(≥9次调用)→ 维持行为多样性,防止 RL 收敛到 collapse 状态。结论:SFT 的行为模式决定 RL 的搜索起点,起点错了 RL 无法自我纠正
RQ2:数据量 vs 质量的权衡?
≥9次调用的 4K 样本,优于以下所有配置:≤5次调用的 40K 样本、≤1次调用的 40K 样本、以及混合正确+错误轨迹的全量 45K 样本。量化结论:数据量的边际价值在冷启动阶段很低,行为质量(工具调用密度)才是决定因素
RQ3:推理预算(inference budget)与训练预算的匹配?
高交互预算(50次工具调用)训练的模型在大推理预算下表现更好;但在极低预算下(仅允许2次工具调用),高交互训练的模型反而差于低交互训练的模型(51.5% vs 32.3%)。这是一个能力-预算对齐问题:训练时的行为分布需要与推理时的资源约束匹配
实际意义:部署时有严格 latency 约束的场景,应该在训练时就加入低工具调用约束,而不是训练高能力模型再截断推理——截断高能力模型在低预算下表现反而下降。

🔗 对 Duplex Agent / Agentic RL 的启示

Interaction Collapse 的 Duplex 类比
Duplex agent 在 RL 训练中同样面临类似风险:模型可能学会"假装在实时交互"(只用 Interaction Layer 输出简单响应),而不是真正驱动 Thinking Layer 进行深度推理——因为后者更复杂、更容易产生错误。这是 duplex agent RL 的一个潜在 collapse 模式,需要类似 ASTER 的"密集交互冷启动"来防止。
对应策略:Duplex agent 的 SFT 冷启动数据应该优先包含"Thinking Layer 真正介入、且介入次数多"的对话轨迹,而不只是"最终质量高"的对话。这与 ASTER 的≥9次工具调用要求在逻辑上完全对称。
arXiv:2602.01204 · Huawei / Nanjing University · February 2026 · 精读:2026-07-14