← 首页|学术|From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use
cs.AI · 2608.24368 · 25 Aug 2026

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use

Rongfeng Guo, Yinxuan Huang, Yusen Wu et al.
💬 直接 function-calling 和 ReAct 把"记状态"和"生成动作"塞进同一条自回归轨迹,导致二者互相争抢注意力;OODA-Tool 借鉴 Boyd 的 OODA 循环,把状态维护和动作生成拆成受控中间态,越小的模型收益越大。

🎯 问题

状态-动作竞争(state-action competition)
可靠的多轮工具使用要求 agent 持续维护一个演化中的任务状态,并保证每个动作都与该状态保持一致。但直接 function-calling 和 ReAct 式策略是在同一条自回归轨迹中同时学习状态追踪和动作生成,这种耦合会造成"状态-动作竞争":生成下一次工具调用的压力可能覆盖或忽略此前交互中积累的信息,导致多轮、多工具场景下状态被静默丢失。

🔬 方法

OODA-Tool:受控闭环的类型化策略
受 Boyd 的 Observe-Orient-Decide-Act(观察-判断-决策-行动)循环启发,作者提出 OODA-Tool,一种把状态维护和动作实现分离开来的类型化闭环策略。它不直接从交互历史生成动作,而是让每次决策都经过受控制器检查的中间状态,确保最终输出始终扎根于当前任务状态。具体地:Observe 重建任务状态,Orient 判断是否应当执行,Decide 形成一个合法的动作结构,Act 再把它落地为对外输出。

📊 结果

作者用 0.6B 到 14B 规模的 Qwen3 系列模型,在多轮、多工具、信息不完整三类设置下,将 OODA-Tool 与直接 function-calling 和 ReAct 策略对比。OODA-Tool 在所有模型规模上都一致提升任务成功率,且在更小模型、以及动作强依赖跨轮次累积信息和历史工具结果的任务上收益更大。受控变体、分阶段消融实验和迁移评估进一步证明了这些提升的鲁棒性。
工具使用多轮交互状态追踪Agent架构OODA循环