← 首页|学术|Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms (LivingScreen)
Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms (LivingScreen)
arXiv ↗
cs.AI / cs.CV 2606.04701

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms (LivingScreen)

BIT-HLP 团队
arXiv 2606.04701 · Jun 2026
💬  第一个把'屏幕自己会动'写进形式化的 GUI benchmark:POMDP + 自治流演化(Δ₁)+ 观察即带参数的一等动作(Δ₂);499 任务/1,528 条短视频;主导失败模式 over-/under-observation——观察控制是 GUI agent 缺失的能力轴。

🧮 形式化

Living-Screen-Native POMDP:Δ₁ 状态在两次决策间按自治流演化(播放头前进、内容自动加载);Δ₂ 观察由 agent 主动发起且带参数(watch(Δt, fps))。

四象限定位:纵轴=环境是否自治演化,横轴=agent 是否作用于环境——living-screen-native 是唯一同时满足两者的象限,短视频平台天然居于此。与 Video QA(喂视频文件、无 GUI)和标准 GUI benchmark(截图间世界冻结)都不同:信息获取必须经过像素级 GUI 交互(滑 feed、拖进度条、展开评论)在自动播放的画布上完成。

环境:浏览器复刻短视频 App,Playwright 驱动真实 Chromium,视频真在自动播放(非录好的帧序列);agent 只能通过截图/录屏观察,无 DOM/视频文件特权。动作空间 = 标准 GUI 原语 + watch(录制指定时长/帧率)+ wait(让自治流前进跳过无信息段)+ mark(坐标校准)+ answer。观察是内生的、有代价的决策——这是 Δ₂ 的实例化。

🧪 任务与指标

499 任务 / 1,528 条中文短视频(均 5.62 条/任务),三层:L1 原子操作 / L2 跨源理解 / L3 闭环应用;SR + NS(步数)+ WR(观看时长占比)。

SR:L1/L3 由环境后端比对终态(如'视频 i 已点赞、视频 j 已举报'精确匹配),L2 选择题匹配。成本双指标:NS=每 episode 工具调用数(操作成本),WR=watch 录制时长占 feed 总时长比例(观察成本)——高 SR + 低 NS + 低 WR 才是主动高效。

被测 13 个前沿模型(Gemini-3.5-Flash/3.1-Pro、Doubao-Seed 系、Qwen-Plus 系、GLM-5V、Kimi-K2.5、Claude-4.6 系、GPT-5.5/5.4),统一 think-then-tool-call 单 agent、30 步上限、只保留最近观察帧。agent 设计消融(episode 长度/观察保留/显式推理)显示 SR 在默认附近波动——瓶颈在底层 MLLM 不在 harness。

📊 结果与失败模式

所有模型远逊人类的成本-准确率前沿(人类 SR 更高且 WR 更低);主导失败 = over-/under-observation:看太多或太少。

四类观察行为(skipped/glanced/partially viewed/fully consumed)分布:模型间最大差异在 fully consumed——Seed-1.8 31.7% 的视频看到底 vs Gemini-3.5 仅 5.7%;看完整视频膨胀 WR 却不换来成比例的 SR。GUI 执行与跨源理解是独立维度(Qwen-3.6 执行强理解弱、Kimi-K2.5 相反),L3 闭环要求两者兼备。

over-/under-observation 被作者定位为 over-/under-thinking 的视觉通道对偶——'观察控制'由此提名为 GUI agent 缺失的能力轴。这是'感知预算分配'失败模式的命名者。

💡 对主线的启示

'屏幕在思考期间演化'表述的占据者,但被测仍回合制、机会不过期(可回看/拖动)——评的是观察控制不是实时行动。

三点:① watch(Δt, fps) 参数化观察与流式模型的感知带宽预算同构,WR 是观察成本的现成度量;② over-/under-observation 词汇可用于三分归因的'看错时机'格;③ related work 点名并标注缺失轴:无流式被测、无时延惩罚、机会不过期。

与近邻的关系:AOI/DynaCU-Bench 给出观察接口的解法侧(narration/keyframe),LivingScreen 给出观察行为的测量侧(WR/四分类);两者都停在 human-paced。机会过期(错过即失败)在 GameWorld/SentinelBench no-op/TickingCollabBench 一线,LivingScreen 不在其中。局限:全中文短视频、L2 靠选择题、13 模型全部回合制 API。

🏷 关键词

living screenGUI agentsautonomous flowagent-initiated observationwatch ratioover-observationshort-videoPOMDPbenchmark