🎯 场景与判分
实时描述=持续输出时间对齐响应(6 子任务);主动提醒=事件发生时主动开口(3 子任务);660 视频均长 34 秒全部 <1 分钟。
判分全自动 LLM-as-Judge(Gemini-3-Flash-thinking):实时描述分 = 0.5×内容一致性(扣分制:事实错/幻觉/遗漏)+ 0.5×时机敏感度;主动提醒按事件时刻后 10 秒窗内是否正确开口判定,多次事件全对才算过。
时机判分的工程细节可移植:multi-window 采样围绕真值时间窗构造 k=4 候选窗,容忍约 2 秒的自然感知-生成延迟、惩罚明显错时,最终分对相关句子平均并加衰减惩罚。Correction 子任务测'基于视频纠正用户描述',Post-Event Reminder 测指令出现在事件之后时关联既往观察的能力。
📊 结果
MiniCPM-o 4.5 全场最好 39.6 vs 人类双工 81.8;主动提醒最好仅 20.0;实时描述中模型约 50–60% 视频时长保持沉默。
被测只有开源双工线:LiveCC (Base/Instruct)、MMDuet2、StreamingVLM、MiniCPM-o 4.5。两大发现:① 完整性-及时性权衡——无法连续描述;② 事件驱动响应是共同短板,'不是不会说、是不知何时说'。错误分布:MiniCPM-o/MMDuet2 以 No Answer(沉默)主导,LiveCC/StreamingVLM 以 Wrong 主导。
能力剖面:感知强推理弱——OCR 68.6(MiniCPM-o)但 Counting 51.4 全场最难,交互关系/世界知识偏低——'能跟踪内容、难整合成连贯推理'。未测 API 侧(Gemini Live/gpt-realtime),与 AOI 论文的流式基线实验互补。
💡 对主线的启示
标题最易混淆的近邻:它测 when-to-speak,零动作、无环境状态变化——点名划界;时机判分协议件可移植到动作时机。
可引数字:主动提醒 20.0 + 50–60% 沉默——开源双工模型连'何时开口'都没解决,是'实时的不会点屏幕'的语音-视频侧证据。可借鉴:0.5/0.5 内容×时机双权重、multi-window 延迟容忍、全事件命中才算过的严格判据。
局限:视频全 <1 分钟、LLM judge 偏置未消、只测开源模型、各模型推理时延如何折入时间轴未统一刻画。对照阅读:AOI/DynaCU-Bench(API 流式+真实 DOM 动作)、DuplexSLA(模型侧动作通道)、LivingScreen(屏幕演化+GUI 动作但回合制)。