← 首页|学术|当历史在撒谎:误导性多轮历史下的工具调用评测与改进
cs.AI · 2608.06057 · 提交于 2026年8月6日

当历史在撒谎:误导性多轮历史下工具使用能力的评测与改进
When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que
💬 持久化交互中,结构上依然合法但语义上已过时的历史轨迹会"劫持"模型本来掌握的正确策略——在Qwen3-1.7B上,被污染的历史能翻转32.1%原本正确的决策。作者提出的Oracle条件教师策略迁移方法,把学生模型在受污染历史下的工具使用准确率从Gold-SFT的66.3%提升到87.0%,且能scale到8B模型的91.9%~93.0%。

🎯 问题

"看起来合法"的过时历史会劫持已有策略
工具调用型agent依靠累积的对话与工具调用轨迹来推断任务状态。但在持久化交互中,历史轨迹可能在结构上依然有效、语义上依然可信,实际上却已经不再对当前请求具有权威性——例如引用了已失效的实体或过时的接口约定。作者发现这类"貌似合法"的历史污染能够劫持模型本来已经具备的正确策略:在Qwen3-1.7B上,污染使32.1%原本在原始轨迹下正确的决策发生翻转,并频繁诱导模型复用已损坏的实体或接口约定。

🔬 方法

bench:Original / Polluted / Oracle State 三视图配对基准
作者构建了一个配对基准(论文中称为bench),提供同步的Original(原始)、Polluted(污染)、Oracle State(理想状态)三种视图,三者保持相同的系统策略、当前工具集、最新请求与标准下一步动作。基于此设计了11种保留标准答案的干预方式,将失败归因拆解到决策状态、实体绑定、接口执行三个层面,覆盖完整调用与非调用决策两类场景。
Oracle条件教师策略的软监督迁移
作者提出的方法(论文中称为ours)让一个以Oracle状态为条件的教师策略,通过对学生模型自身生成前缀的软监督,将知识迁移给一个只能看到被污染历史的学生模型,而非依赖硬标签蒸馏。

📊 结果

显著优于多种基线,且可规模化迁移
在Qwen3-1.7B上,该方法达到87.0%的平衡工具使用准确率(Balanced Tool-Use Accuracy),显著优于Gold-SFT(66.3%)、Oracle序列蒸馏(82.3%)和离策略token蒸馏(85.0%)。该方法可规模化:用8B教师模型指导同样的1.7B紧凑学生模型,能将其准确率提升到91.9%;若学生模型本身也是8B,则达到93.0%。得到的策略还能进一步迁移到干净历史、未见过的函数、独立重新生成的评测上下文、外部工具使用基准以及带噪声的多跳问答任务,展现出较强的跨场景泛化性。

💡 我的看法

"历史可靠性"作为一个独立的工具使用瓶颈被明确提出,这个视角对duplex agent架构很有启发:全双工交互天然是持久化、多轮、状态不断演化的场景,Interaction Layer快速响应所依赖的上下文历史,随时可能因为用户中途改变意图、打断、纠正而变得"结构合法但语义过时"——这正是论文里描述的污染模式。如果一个duplex agent的Thinking Layer在做深度推理时无法识别历史中哪些片段已经失效,就可能重复利用过时的实体绑定或接口约定,产生错误响应却毫无察觉,这与论文中"复用已损坏的实体或接口约定"的失败模式高度吻合。Oracle条件教师软监督迁移这一训练思路也值得借鉴——它本质上是让学生在自己实际会遇到的(受污染的)分布上学习修正,而不是死记硬背理想状态下的答案,这种"在自身生成前缀上做软监督"的训练范式或许可以迁移到duplex agent的状态一致性训练中。局限在于目前验证仅限于1.7B~8B级别模型和特定基准,污染注入方式是否覆盖了真实多轮对话(尤其是语音交互)中历史失效的全部模式,仍需更多验证。
Tool UseMulti-TurnDistillationAgent RobustnessContext Pollution
来源: arXiv:2608.06057