🎯 问题
CU agent 每步一张截图、无音频:步间对视频/动画/瞬态 UI 盲、对语音聋。先前工作只丰富单帧编码,没人动'何时看、用哪些感官'。
对标 SWE-agent 之于 action interface:观察接口是被忽略的对偶设计轴。模型侧修不动——重训视频 CU 模型贵且未验证,视频原生模型暴力采帧浪费 token,实时多模态 API 锁供应商无选择性感知。核心原则:观察(连续、自适应、多模态)与动作(离散)解耦。
AOI 三组件全带门控:① 步间关键帧——像素门(Δpx<1% 跳过,<1ms)→ CLIP-ViT-B/16 语义距离(~7ms)超阈值才捕获,每步最多 5 帧;② 音频——RMS 静音门 → Whisper v3 按需转录;③ 视觉旁白 narration——CU 模型自己把捕获帧叙述成持久文本,源图像随后剪枝(易失视觉时序→持久文本记忆)。静态无声内容上几乎零输出,退化回标准循环,静态 50 题对照无退化。
🧪 DynaCU-Bench
100 动态浏览器任务(10 族×10 题、AUD/VIS/INT 三轴)+ 50 静态对照;headless Chromium + 虚拟声卡 + TTS;93 题确定性判分。
任务族:Podcast/Phone/Interview(音频)、Meeting(AUD+VIS+INT)、Screencast/Carousel/Dashboard/Transient(视觉时序)、Collab(远程协作编辑)、Games(VIS+INT 实时游戏)。每族 3 易 4 中 3 难。15 步或墙钟预算(刺激时长+固定余量)截止。
统计协议可抄:单 trial 100 二值任务、95% Wilson CI、配对 McNemar 精确 mid-p 检验;headline 配置重跑 3 seed 得 82/78/76(std 3.1pp)——±3pp 解码噪声带内的差异一律当噪声。评测全部在自建 harness 实测,不用厂商自报数。
📊 结果
Claude 4.6 38→82(+44)、Gemini 2.5 Flash 21→69(+48 最大)、GPT-5.4 37→57、Qwen3-VL-235B 22→64;除 Gemini 3 Flash 外全部 p<1e-3。
三个结构性发现:① 关键帧'选择'基本不重要,价值来自把帧叙述成持久文本(narration);② Gemini 2.5 的 +48 拆成 +25pp 结构化 prompt + +23pp 步间感知;③ Gemini 3 Flash 上关键帧流通过 image-token 稀释反而回归(+9, p=0.18)——组件须按模型选配。音频族从近乎不可能到近乎全解;Dashboard 收益最小(单帧已可见);Games 是唯一跨模型一致回归。
效率反直觉:AOI 更便宜——步数减半(更准的步)盖过每步更贵,token 成本降 15–50%(Claude/Gemini −50%);但快模型墙钟变慢(观察开销>省下的步时)。难度分层:Claude 易 57→93、中 38→85、难 20→67;Fara-7B 收益集中在易题——感知≠推理,小模型的绑定约束是推理容量。Grok-4 慢推理(80–180s/call)把绝对分压死,作者加低时延 Grok 变体对照——推理时延即使在 human-paced 任务里也构成地板。
📡 流式模型对照
12 题音频子集:Gemini Live 0%、gpt-realtime-2 裸 17%(听得清落不了地)、+AOI 元素列表 92%——缺口在 action grounding 不在感知。
实验设置:把 Gemini Live / OpenAI Realtime 经 websocket 接入(每任务一个会话,原生音频+截图流入,返回的 tool call 在真实浏览器执行)。gpt-realtime-2 转录近乎完美(日志显示每个名字数字都听到)却定位不到表单字段;给它 AOI 的 [PAGE ELEMENTS] 交互元素列表后从 17% 到 92%,与 AOI full 打平。Grok Voice(无视觉)加 scaffold 也无用——从反方向证明'感知无接地的动作不够'。
对 duplex-omni-actor 的查新意义(最危险近邻):它已经把流式模型接上真实浏览器 DOM 闭环执行——'流式模型操作真实视觉环境'不再是零先例。但三个缺失轴:仅 12 题音频子集 baseline(非主角地位)、任务 human-paced(作者两处原话 'AOI targets human-paced computer use, not real-time interaction')、无时延-成败关系测量。Games 加接口反倒退(观察开销把 agent 推出反应窗)反而支持'实时场景瓶颈在动作/推理时间预算而非感知带宽'。引用纪律:17%/92% 是 12 题子集数字,不是 100 题主表。
💡 对主线的启示
first 措辞因它收窄;'听得清落不了地'是 grounding 缺口最干净证据;文本契约动作通道与 [PAGE ELEMENTS] 同构。
三点:① related work 必点名并标缺失轴(流式主角×墙钟推进×时延测量交集仍空);② 给流式模型配动作 grounding scaffold 是激活闭环能力的最短路径——预期发现的直接佐证;③ 观察侧 scaffold 在动作时延受限场景是负资产(Games 回归),分层判断有据。
narration 机制值得单独记:把易失视觉时序压成持久文本,与流式 CoT 摊销是同一时间冗余杠杆的感知侧版本。局限清单(作者自述):屏幕 ~3Hz、亚 300ms 事件出界、音频只做语音、narration 会固化误读、合成音频+受控浏览器的外部效度未验。对照阅读:GameWorld(其 Games 回归正落在 GameWorld 测的反应窗任务上)、LivingScreen(屏幕会动但被测回合制)、Omni-DuplexEval(流式评测但零动作)。