← 首页|学术|CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting
cs.AI · 2608.20771 · 21 Aug 2026
CAS: Conformalized Agentic Search via Adaptive Retrieval and Policy Weighting
Zixi Zhu, Jiayuan Su, Jian Zhang, Yu Lin, Hongwei Wang
💬 RL 训练出来的搜索 agent 有两条并发的失效路径:检索端用 heuristic Top-K 截断证据,训练端因为 RL 带来的过度自信而学会"幻觉式作答、冗余搜索"。CAS 把 Conformal Prediction 的统计覆盖保证同时接到这两个环节——检索时用自适应预测集动态截断文档,训练时用动态置信度惩罚不可靠轨迹的 GRPO 目标——试图让"可靠性"变成一个可量化、可控的训练信号,而不是靠经验调参碰运气。
🎯 问题
RL 微调把搜索 agent 变得"既漏证据又太自信"
Search Agent 在 RL 微调阶段面临一场"严重的可靠性危机":一方面,检索环节普遍采用 heuristic Top-K(固定数量截断),要么把关键证据挤出窗口(evidence loss),要么把无关噪声硬塞进上下文;另一方面,随着 RL 训练不断推进策略趋于收敛,模型逐渐产生过度自信(over-confidence),表现为幻觉式作答和重复无效的工具调用(redundant searches)。这两个问题分别发生在推理时的检索侧和训练时的策略优化侧,此前的工作大多只单独处理其中一个环节,没有把"检索该截多少"和"这条轨迹该不该被信任"统一到同一套可靠性框架下。
Conformal Prediction(CP,保形预测)是一类不依赖模型内部结构、只需要校准数据即可给出统计覆盖保证的黑盒不确定性量化方法——给定一个目标覆盖率(如 90%),CP 能构造一个"预测集",保证真实答案落在集合内的概率不低于该目标,且集合大小会随样本难度自适应变化(简单样本给小集合,模糊样本给大集合)。这正是论文用来同时约束"该检索多少文档"和"该多信任这条推理轨迹"的数学工具。
🔬 方法
两处覆盖保证:检索端截断 + 训练端置信度惩罚
检索侧 — Adaptive Prediction Set(APS):这是 CP 的一种具体实现,把统计覆盖率的保证直接转译成动态的文档截断策略——不再用固定的 Top-K,而是根据当前查询的检索分数分布,构造一个大小自适应的预测集,只在有把握覆盖到关键证据时才截断,模糊或有歧义的查询会自动获得更大的证据窗口,缓解"一刀切"截断带来的证据丢失或噪声混入问题。
训练侧 — Adaptive Conformal Inference(ACI):这是一种动态 CP 算法,能在训练过程中持续构造具有可控覆盖率的预测集,用来量化模型对当前答案的置信度。这个置信度信号被直接接入 Group Relative Policy Optimization(GRPO)的目标函数,对低置信度的轨迹施加惩罚,使得策略更新只从可靠的推理轨迹中学习,而不是被过度自信但实际上错误或冗余的轨迹带偏。
关键设计思路:把"可靠性"从事后过滤/人工设定阈值,转变为训练全程中统计上可控、覆盖率有保证的信号——检索端和训练端共享同一套 CP 语言,而不是两套独立的启发式规则。
▶ 论文摘要中未展开的实现细节
abstract 未给出 APS/ACI 的具体校准集构造方式、覆盖率目标取值、以及 ACI 在 GRPO 目标中的具体惩罚项形式(如是否作用于 advantage 加权或直接调整 reward)。代码仓库链接为 github.com/S1llyBird/CAS(页面提供,未独立验证内容)。
📊 结果
单跳与多跳 QA:更准也更省
论文在单跳(single-hop)和多跳(multi-hop)QA 数据集上进行实验,报告称该框架"显著提升推理准确率,同时大幅减少冗余工具调用"。arXiv 摘要页未公开具体的数值指标(如准确率百分比、工具调用次数对比表),本文未获取论文全文(21页含图表附录),故不在此处编造数字 ——如需精确对比数据,建议查阅 PDF 正文的实验表格。
💡 与 Duplex Agent 方向的关联
"用统计覆盖保证换可控可靠性"是可迁移的训练范式
CAS 解决的核心矛盾——RL 训练让 agent 越来越自信,但自信和正确并不同步增长——和全双工/duplex agent 训练中一个几乎同构的问题相关:duplex agent 在实时交互中同样需要对"何时该说话、何时该继续想"做出置信度判断,而单纯用 RL 优化交互质量同样有可能学出过度自信的 turn-taking 决策(该等待的时候抢话,该打断的时候沉默)。CAS 把 Conformal Prediction 接入 GRPO 目标、用统计覆盖率而非固定阈值来惩罚不可靠轨迹的思路,为 duplex agent 的策略训练提供了一个可参考的模式:与其手工设定"什么时候该 barge-in"的启发式规则,不如给交互决策也接一层可控覆盖率的置信度信号,让训练本身学会"什么时候该谨慎"。这与 DuplexWorld 报告中提到的"under-effort 份额是最好的失败预测器"是同一类问题的两种视角——都在寻找能提前量化、进而纠正"过度自信/欠努力"的信号。
一句话类比:CAS 用 Conformal Prediction 校准搜索 agent 的检索窗口和训练置信度,本质上和 duplex agent 需要校准"何时打断/何时等待"的置信度是同一个统计问题的两种应用场景。
Agentic RL
Conformal Prediction
Search Agent
GRPO
Tool Use