← 首页|学术|Behavior Priming: Beneficial Reasoning Behaviors in Agentic Search
cs.IR cs.AI cs.CL · 2510.06534 · Oct 2025
Beneficial Reasoning Behaviors in Agentic Search
Jiahe Jin, Abhijay Paladugu, Chenyan Xiong — Carnegie Mellon University, Language Technologies Institute
Agentic Search
Behavior Priming
SFT + RL
Reasoning Behaviors
Agent Training
核心论点:Agentic search 需要的不仅仅是搜索能力,而是4类可命名的推理行为:信息核实、权威性评估、自适应搜索策略、错误恢复。先用携带这4类行为的 SFT 数据做"行为灌注",再跑 RL,比直接 RL 在 web benchmark 上提升 +37.2%。SFT 数据的行为质量比任务准确率更关键。
🎯 问题:Agentic Search 的推理行为黑箱
LLM 做 agentic search 时在"想什么"?
现有 agentic search 系统将推理过程当作黑箱——直接用 RL 优化任务结果,不关心中间推理的形式和内容。这导致两个问题:
- RL 优化出来的行为难以解释,也难以定向改进
- 训练效率低:模型需要从零探索哪些推理策略有效,大量 rollout 浪费在无效的搜索模式上
本文的出发点:
先系统识别什么推理行为是有益的,然后通过 SFT 主动注入这些行为,再用 RL 强化。
🔬 四类有益推理行为
通过对成功 vs 失败的 agentic search 轨迹进行 LLM 驱动的对比分析,作者识别出4类在成功轨迹中显著出现、在失败轨迹中缺失的推理行为:
① 信息核实(Information Verification)
搜索到信息后,不直接采用,而是主动在其他来源交叉验证。有效的信息核实不是简单"再搜一次",而是有意识地寻找独立的、不同角度的来源来支持或反驳当前结论。
失效模式:agent 找到一个看起来可信的来源后就停止搜索,导致对错误信息无感知。
② 权威性评估(Authority Evaluation)
对不同信息源的可信度进行显式评分——区分一手文献与转述、专业机构与个人博客、时效性高与过时的内容。当信息源之间发生冲突时,有原则地偏向权威来源而不是随机取一。
失效模式:agent 把维基百科摘要和原始研究论文等同对待,或因信息源冲突而陷入循环搜索。
③ 自适应搜索策略(Adaptive Search)
根据搜索结果的反馈动态调整搜索策略——如果当前查询没有返回有用信息,不是重复同样的查询,而是改变关键词、缩小/扩大搜索范围、或者切换搜索维度(如从"是什么"改为"谁发现了")。
失效模式:agent 陷入相同查询的无效循环,消耗大量 token 但信息增量接近零。
④ 错误恢复(Error Recovery)
当推理路径出错时,能主动检测到偏差并回退到更早的正确分叉点,而不是继续沿错误路径走到底。包括识别"当前收集的证据相互矛盾"、"搜索陷入了一个不相关的子话题"等信号。
失效模式:agent 一旦走错路就继续走,最终以错误答案作答或放弃。
🔬 Behavior Priming 训练方法
两阶段:行为 SFT → 标准 RL
阶段一:Behavior Priming SFT
用 LLM 标注现有轨迹,筛选出包含上述4类行为的高质量轨迹,在这些轨迹上做 SFT。关键取舍:筛选标准是行为质量(轨迹中是否体现了这4类行为),而不是任务结果(最终答案是否正确)。
阶段二:标准 RL
在行为灌注后的模型上进行正常 RL 优化,以任务准确率为奖励。行为先验让 RL 的起点更好,探索空间更有结构。
关键设计选择:SFT 数据的行为质量 > 结果正确性。这意味着一条轨迹即使最终答案错了,但如果过程中体现了清晰的权威性评估 + 自适应搜索,也会被选入 SFT 数据。这与 DLCoT(保留错误探索路径)和 ASTER(不追求 SFT 准确率)指向同一原则。
📊 主要结果
vs 直接 RL (web)
+37.2%
相对提升
vs 直接 RL (multi-hop)
+6.2%
相对提升
vs outcome-SFT
优于
行为质量 > 结果质量
| 方法 | Web Benchmarks | Multi-hop QA | Pass@8 |
| Behavior Priming + RL | 最强 | 最强 | 提升明显 |
| 直接 RL(无 SFT) | base | base | base |
| Outcome-correct SFT + RL | 次之 | 次之 | 次之 |
| 纯 SFT(无 RL) | 较差 | 较差 | — |
▶ 实验设置细节
Base models:Qwen3-1.7B,Llama3.2-3B-Instruct(小模型验证,证明行为灌注在小模型上同样有效)
评测 benchmarks:3 个 web benchmarks(类 BrowseComp 难度)+ 7 个 multi-hop QA(WebWalkerQA, NaturalQuestions, TriviaQA, HotpotQA, MuSiQue, 2WikiMultiHop, GAIA, Humanity's Exam)
Pass@8 指标:在 8 次独立搜索尝试中至少有 1 次成功的概率——衡量模型的探索覆盖范围。Behavior Priming 在此指标上提升明显,说明行为灌注提升了策略的多样性。
特别值得注意:行为灌注在 web benchmark 上的提升(+37.2%)远大于 multi-hop QA(+6.2%)。这符合直觉——web 搜索的信息环境更嘈杂、更需要权威性评估和错误恢复,而标准 multi-hop QA 的信息结构更干净,直接 RL 也能学到。
💡 方法论意义:行为分类的泛用性
四类行为的迁移价值
这4类行为并非 web search 专属。从 agentic 任务的通用角度看:
- 信息核实 → 任何依赖外部信息的 agent task(代码 agent 验证 API 文档、RAG agent 交叉验证来源)
- 权威性评估 → 所有需要在多个信息源间做选择的场景
- 自适应搜索 → 任何迭代式 agent loop(不收敛时改变策略而非重复)
- 错误恢复 → 所有长时域 agent task 的通用需求
与 WebSailor 对照:WebSailor 问"如何训练出能缩减不确定性的 agent"——答案是构造专门的高不确定性训练任务(信息遮蔽)。Behavior Priming 问"agent 在缩减不确定性时需要哪些具体行为"——答案是这4类行为。两篇相当于给出了同一能力的
训练数据视角(WebSailor)和
行为分解视角(Behavior Priming)。参见:
WebSailor 精读
对 Duplex Agent 训练的潜在启示
Duplex agent 的 Thinking Layer 在异步推理时,同样需要类似的"元认知行为":知道当前信息是否足够、何时需要等待更多上下文、何时检测到对话已经偏离预期。Behavior Priming 的框架提供了一个可操作的路径:先识别 Thinking Layer 的有益行为模式,再系统地构造体现这些行为的训练数据,而不是期望 RL 自己从头发现。
局限:4类行为的识别依赖 LLM 标注,可能受限于标注模型的理解能力。在更复杂的 agentic 场景中,有益行为的分类可能需要扩充——本文只研究了信息检索类任务,对工具使用、代码执行等场景的行为分类尚未覆盖。
arXiv:2510.06534 · Carnegie Mellon University, LTI · October 2025 · 精读:2026-07-14