← 首页|学术|CIPO:面向搜索Agent的上下文信息策略优化
cs.AI · 2608.06128 · 提交于 2026年8月6日

CIPO:让搜索Agent的推理真正扎根于检索证据
Contextual Information Policy Optimization for Search Agents

Xingyu Guo, Wei Chen, Linlin Yang, Baochang Zhang
💬 搜索agent常常"先有结论、再找检索去佐证",出现确认偏误(confirmation bias)而非真正依据检索证据推理。CIPO是一种证据导向的强化学习框架,给"是否真正依据检索信息调整推理"的动作分配密集的轮级信用,并结合全局结果奖励,在七个域内/域外基准上有效抑制了这种"先验驱动推理"倾向。

🎯 问题

奖励只看结果,agent学会了"检索走过场"
搜索agent让大语言模型能够在多步推理过程中获取并使用外部证据,超越静态的参数化记忆。但对于知识密集、信息复杂或不断演变的任务而言,agent的可靠性不仅取决于能否检索到相关证据,更取决于能否真正用这些证据来指导后续推理。现有方法主要奖励最终答案的正确性或中间过程的"进展",却没有直接评估检索之后的行动是否真的扎根于(grounded in)检索到的证据。这种错位会鼓励一种"先验驱动的推理"(prior-driven reasoning):agent基于内部已有知识先形成结论,检索主要被用来确认这个结论,而不是真正参与推理过程,最终导致确认偏误和检索效率低下。

🔬 方法

CIPO:证据使用信号 + 全局结果奖励
Contextual Information Policy Optimization(CIPO)是一种证据导向的强化学习框架,将策略优化显式对齐到"外部证据使用"这一目标上。具体做法是:给那些受检索信息影响的推理动作赋予密集的、轮级(turn-level)的信用,再将这一"证据使用"信号与全局的结果奖励相结合进行策略优化。这样一来,CIPO 抑制了脱离证据的猜测式回答,鼓励生成那些能够让检索到的事实真正引导或修正后续推理的推理轨迹。方法的一个重要特点是不需要人工的过程标注,也不需要额外训练一个奖励模型。

📊 结果

七个基准上有效降低先验驱动推理
在七个域内和域外基准上的大量实验表明,CIPO 有效降低了先验驱动推理的发生比例,并在多数任务上取得了优异表现。(摘要未给出具体数值指标,结果以定性趋势描述为主。)

💡 我的看法

这篇论文提出的问题——"检索到的证据是否真正影响了后续推理"——本质上是一个可观测性/可归因性问题:奖励信号只能看到"最终答案对不对",看不到中间推理链条是否真的依赖了检索内容。这与你关注的duplex agent架构中"推理层输出是否真正被交互层采纳、还是被忽略/覆盖"的问题有一定的结构相似性——DuplexOmni这类两层架构里,Thinking Layer产出的深度推理结果同样存在"是否被Interaction Layer真正采纳、还是被表层反应绕过"的风险,CIPO这种给"信息是否被使用"单独设计密集轮级信用的思路,或许可以启发如何评估/训练"深度推理结果对实时交互决策的实际影响力"这一子问题。但需要指出,摘要中没有给出具体的性能提升数值,也没有说明CIPO用什么方式量化"某个推理动作是否受到检索信息影响"这一核心技术细节(很可能依赖某种归因或对比机制),这部分需要看正文或HTML版本才能判断方法的严谨程度和可迁移性。整体上这是agentic RAG/搜索agent训练里一个方向正确、但摘要层面细节偏薄的工作。
Search AgentRAGRLConfirmation Bias
来源: arXiv:2608.06128