← 首页|学术|WebSailor: Navigating Super-human Reasoning for Web Agent
cs.AI cs.CL cs.IR · 2507.02592 · Jul 2025
WebSailor: Navigating Super-human Reasoning for Web Agent
Kuan Li, Zhongwang Zhang, Huifeng Yin et al. (19 authors) — Alibaba Tongyi Lab
Web Agent
Agentic RL
Uncertainty Reduction
DUPO
BrowseComp
核心论点:开源 web agent 与专有系统(DeepResearch)的差距,根源不在工具使用机制,而在极端不确定性下的系统性认知缩减能力。WebSailor 通过"信息遮蔽"构造专门针对不确定性缩减的训练任务,配合 RFT 冷启动 + DUPO(专为长时域 web agent 设计的 RL 算法),首次让开源 72B 模型在 BrowseComp 上接近专有系统水平。
🎯 问题:BrowseComp 揭示的能力差距
BrowseComp:当前最难的 web 搜索 benchmark
BrowseComp 的每道题需要 10 步以上的推理才能找到一个精确事实答案,要求 agent 在海量网页信息中系统追踪线索、排除干扰、最终收敛到唯一正确答案。专有系统(如 OpenAI 的 DeepResearch)可以达到 20%+ 的英文准确率,而此前最强的开源系统基本在 5% 以下——差距巨大。
为什么会有这个差距?作者认为不是工具调用能力的问题——开源模型也能搜索和浏览网页。核心差距在于不确定性感知与缩减策略:面对多条相互矛盾的信息源,开源模型不知道如何系统地判断哪条更可信、如何制定下一步搜索来消除歧义,最终陷入随机游走或过早放弃。
🔬 方法:WebSailor 训练管道
核心创新一:结构化信息遮蔽(Structured Information Obfuscation)
WebSailor 的训练数据生成策略:给定一个有确定答案的问题,通过结构化信息遮蔽将其改造为高不确定性版本——刻意移除或混淆直接线索,强迫 agent 必须经过多步推理和信息核实才能到达答案。
这不是简单地"把问题变难",而是专门针对"不确定性缩减"这个能力设计训练信号——模型必须学会主动探测信息边界、系统排除假阳性,而不只是检索。
与标准 web QA 的区别:标准 web QA 的答案通常可以通过 1-2 次精准搜索找到,不要求不确定性管理。BrowseComp 类任务的答案被精心设计为必须通过多步交叉验证才能确定。WebSailor 通过遮蔽合成大量这类训练样本,解决了"难题训练数据稀缺"的问题。
核心创新二:SailorFog-QA benchmark
配套的可扩展评测 benchmark,基于图采样 + 信息遮蔽技术合成,具有可调难度。支持在不依赖人工标注的前提下大量生成高不确定性评测题,解决了 BrowseComp 规模有限的问题。同时作为训练数据源使用。
训练流程:RFT 冷启动 → DUPO RL
Step 1:RFT 冷启动
用专家轨迹进行 Rejection Fine-Tuning,为模型注入基本的不确定性推理模式。与 ASTER 的"交互密集型 SFT"类似——冷启动的目的是建立正确的行为先验,而不是刷任务准确率。
Step 2:DUPO(Duplicating Sampling Policy Optimization)
专为长时域 web agent 任务设计的 RL 算法。标准 GRPO 在 web agent 场景下样本效率低——一条 web 轨迹执行时间长、奖励稀疏。DUPO 通过复制采样(duplicating sampling)提高 rollout 效率,让同一起始状态产生更多有效 policy 更新,减少无效的网络交互等待时间。
📊 主要结果
BrowseComp-en
12.0%
WebSailor-72B
BrowseComp-zh
30.1%
中文显著优于英文
| 系统 | BrowseComp-en | BrowseComp-zh | GAIA | 类型 |
| WebSailor-72B | 12.0% | 30.1% | 55.4% | 开源 |
| DeepSeek-R1-Browse | ~10% | ~20% | 竞争级 | 开源 |
| Doubao-Search | — | ~25% | — | 专有 |
| Grok-3 (DeepSearch) | ~15% | — | — | 专有 |
| 此前最强开源 | <5% | <10% | ~45% | 开源 |
▶ 为什么中文成绩(30.1%)远高于英文(12.0%)
BrowseComp-zh 的任务本身对中文信息源依赖更高,而 Alibaba Tongyi 的基础模型在中文互联网内容上预训练更充分。此外,中文 web 信息的噪声分布与英文不同,Tongyi 模型的训练数据偏差在中文场景下更有利。这个差距本身是一个有趣的信号:不确定性缩减能力与底层知识储量密切相关,知识基础更强的领域 agent 表现显著更好。
💡 核心洞察:不确定性缩减作为独立能力
为什么这个框架值得关注
WebSailor 提出的最重要论点不是方法本身,而是对
"web agent 能力缺口"的诊断:
- 工具使用(搜索、浏览、提取)是低级能力,开源已基本持平
- 高级差距在于认知策略层:在信息不完整、相互矛盾的情况下,如何系统地规划下一步搜索?如何评估当前信息量是否足够做出判断?
- 这种"元认知"能力需要专门的训练数据——标准 web QA 根本不包含这类信号
与 Behavior Priming 对照:两篇对同一问题给出了不同粒度的答案。WebSailor 从
宏观能力视角出发:web agent 缺少的是"不确定性缩减"这种系统性认知能力,需要通过专门设计的训练任务来培养。Behavior Priming 从
微观行为视角出发:把这种宏观能力分解为4个可命名、可操作的行为模式(信息核实、权威性评估、自适应搜索、错误恢复)。两篇合读等于拿到了这个能力的宏观框架 + 微观分解。参见:
Behavior Priming 精读
局限:WebSailor 的训练和评测以中文信息环境为主要优势区间,英文 BrowseComp 的 12.0% 仍显著低于专有系统最高水平(~20-25%)。DUPO 算法细节在论文中披露有限,复现成本较高。
arXiv:2507.02592 · Alibaba Tongyi Lab · July 2025 · 精读:2026-07-14