← 首页|学术|Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation
cs.AI · 2608.20797 · 21 Aug 2026

CRATE: 面向移动智能体的自动化轨迹评估 — 步骤级后果推理与聚合

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng
💬 现有的移动智能体"整段轨迹一次性喂给VLM打分"的评测方式,既造成上下文过载又只关心任务是否完成、不管过程安不安全。CRATE 把评测拆成"逐步推理后果 → 汇总判定"两阶段,用中等规模开源VLM就在 AndroidWorld 上把 F1 刷到 0.833(比 SPA-Bench 高20%),并同架构衍生出安全评测版本 CRATE-S。

🎯 问题

整体式(holistic)轨迹评测的两个硬伤
现有基于VLM的自动评测把整条轨迹(几十张截图+动作序列)一次性塞进模型上下文来打分,带来「上下文过载」——模型要在海量视觉噪声里定位关键证据,判断质量随轨迹变长而下降。更关键的是,这类方法几乎全部只关注"任务是否完成",而移动智能体在执行过程中可能触发破坏性操作、隐私泄露、被prompt injection劫持等风险,这部分「操作安全性」在评测体系里长期缺位。
VLM-as-judge:用视觉语言模型替代人工/规则脚本给智能体轨迹打分的评测范式,近年来是移动/GUI agent评测从"规则匹配"转向"模型化、可扩展评测"的主流方向,但如何把长轨迹喂给模型而不丢信息、不引入幻觉,一直是核心难点。

🔬 方法

两阶段 VLM-as-judge:先拆解、再聚合
阶段一 · 步骤级后果推理:对轨迹中每一步(动作前截图+动作),VLM独立生成两类证据——任务相关的视觉线索 c_i,以及仅依据"动作前截图+动作本身"推断出的动作效果 e_i,不需要额外的动作后截图。这样既省去了冗余的跨状态计算,又保留了对动作后果的推理能力;各步骤相互独立,可以并行/批量推理,本质上是一层语义压缩,把长轨迹里的视觉噪声先过滤掉。
阶段二 · 轨迹级聚合:把所有步骤级证据、任务描述和最终截图一并交给VLM,模型先列出任务成功所需的必要条件,逐条核对是否满足,最后给出二元成功/失败判定。这种"先分解证据、再逐条验证"的结构大幅降低了单次推理的负担,使得中等规模的开源VLM也能给出可靠判断。
关键设计取舍:把"动作后果推断"下沉到步骤级独立完成,让轨迹级聚合阶段只需要做证据核对而不是从头理解整条轨迹——这是它能用开源VLM达到高F1的核心原因。
CRATE-S:同一套架构复用于安全评测
CRATE-S 复用相同的两阶段流水线,但不依赖任务描述(task-agnostic),转而标记破坏性操作、隐私泄露、prompt injection等风险类别。每一步额外输出一个二元风险标签 r_i 用于细粒度定位问题发生的具体步骤,轨迹级则给出偏保守的整体安全判定。
VLM-as-judgeMobile AgentTrajectory EvaluationOperational Safety

📊 结果

0.833
CRATE F1 · AndroidWorld
+20%
相对 SPA-Bench
0.697
CRATE-S F1 · MobileRisk
任务完成评测(AndroidWorld,Qwen2.5-VL-72B作为backbone)
方法F1
CRATE0.833(Accuracy 0.930,最优)
A3-FS0.773
SPA-Bench0.623
在作者自建的 CRATEBench(187个任务、覆盖35个App,含24个中国常用App与11个全球App)上,CRATE同样领先:Qwen2.5VL下F1为0.815,换成GPT-4o为0.760,两种backbone下都是最高分。
安全评测(MobileRisk,102条安全轨迹 + 102条不安全轨迹)
方法F1Step-level score
CRATE-S0.69728.8
OS-Sentinel(此前SOTA)0.63023.5
消融实验:去掉步骤级推理会怎样
在CRATEBench上去掉步骤级推理、直接让Qwen2.5VL整体式判断轨迹,模型出现「过度乐观偏差」——不加区分地倾向预测成功,Recall飙到1.000,但Precision从0.733骤降到0.480。这反过来证明步骤级压缩才是解锁开源VLM可靠评测能力的关键,而不是模型本身能力不够。

💡 关联性

对其他Agent轨迹评测工作的启发
CRATE的核心思路——把"逐步后果推理"和"整体证据聚合"解耦,本质上是一种通用的长轨迹评测范式,不限于移动GUI场景:任何需要VLM/LLM-as-judge对多步骤智能体轨迹(网页操作、具身操作、工具调用链)做整体判断的场景,都可能遇到同样的"上下文过载→过度乐观偏差"问题。其"步骤独立推理+可并行、聚合阶段做条件核对"的结构,以及"同一套流水线复用于任务完成判定与操作安全判定"的设计,对duplex/实时agent场景中"边执行边评估"式的过程监督也有参考价值。
▶ 原文摘要 Abstract
Evaluating language-guided mobile agents has recently shifted from rule-based to model-based approaches to achieve scalable and automated assessments. However, existing holistic evaluation paradigms process entire trajectories at once, leading to substantial context overload. Moreover, they primarily focus on task completion while overlooking operational safety. To address these limitations, we introduce CRATE, a novel two-stage VLM-as-judge framework for automated mobile agent evaluation that is compatible with both open- and closed-source models. Leveraging a step-level consequence reasoning mechanism, CRATE independently extracts task-relevant visual clues and infers action-conditioned state changes at each step. The resulting step-level textual evidence is then synthesized through trajectory-level aggregation to deliver an evidence-grounded evaluation of task completion. Building upon this evaluation scheme, we further extend CRATE to CRATE-S for operational safety assessment. Extensive experiments validate the effectiveness and robustness of both CRATE and CRATE-S. Powered by Qwen2.5-VL-72B-Instruct, CRATE achieves an F1-score of 0.833 on AndroidWorld (outperforming SPA-Bench by 20%), while CRATE-S reaches an F1-score of 0.697 on MobileRisk, demonstrating strong alignment with benchmark ground truths.
Mobile AgentEvaluationSafetyBenchmark
来源:arXiv 2608.20797(abs + HTML 全文)