← 首页|学术|Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
arXiv ↗
cs.CV / cs.CL 2605.17360

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

清华 + 上海期智 + ModelBest (OpenBMB 生态)
arXiv 2605.17360 · May 2026
💬  660 个短视频上评开源双工模型'边看边听边说':实时描述+主动提醒两场景 9 子任务,零动作;最好模型 39.6(人类 81.8),主动提醒仅 20.0——模型的困难不在说什么、在什么时候说。

🎯 场景与判分

实时描述=持续输出时间对齐响应(6 子任务);主动提醒=事件发生时主动开口(3 子任务);660 视频均长 34 秒全部 <1 分钟。

判分全自动 LLM-as-Judge(Gemini-3-Flash-thinking):实时描述分 = 0.5×内容一致性(扣分制:事实错/幻觉/遗漏)+ 0.5×时机敏感度;主动提醒按事件时刻后 10 秒窗内是否正确开口判定,多次事件全对才算过。

时机判分的工程细节可移植:multi-window 采样围绕真值时间窗构造 k=4 候选窗,容忍约 2 秒的自然感知-生成延迟、惩罚明显错时,最终分对相关句子平均并加衰减惩罚。Correction 子任务测'基于视频纠正用户描述',Post-Event Reminder 测指令出现在事件之后时关联既往观察的能力。

📊 结果

MiniCPM-o 4.5 全场最好 39.6 vs 人类双工 81.8;主动提醒最好仅 20.0;实时描述中模型约 50–60% 视频时长保持沉默。

被测只有开源双工线:LiveCC (Base/Instruct)、MMDuet2、StreamingVLM、MiniCPM-o 4.5。两大发现:① 完整性-及时性权衡——无法连续描述;② 事件驱动响应是共同短板,'不是不会说、是不知何时说'。错误分布:MiniCPM-o/MMDuet2 以 No Answer(沉默)主导,LiveCC/StreamingVLM 以 Wrong 主导。

能力剖面:感知强推理弱——OCR 68.6(MiniCPM-o)但 Counting 51.4 全场最难,交互关系/世界知识偏低——'能跟踪内容、难整合成连贯推理'。未测 API 侧(Gemini Live/gpt-realtime),与 AOI 论文的流式基线实验互补。

💡 对主线的启示

标题最易混淆的近邻:它测 when-to-speak,零动作、无环境状态变化——点名划界;时机判分协议件可移植到动作时机。

可引数字:主动提醒 20.0 + 50–60% 沉默——开源双工模型连'何时开口'都没解决,是'实时的不会点屏幕'的语音-视频侧证据。可借鉴:0.5/0.5 内容×时机双权重、multi-window 延迟容忍、全事件命中才算过的严格判据。

局限:视频全 <1 分钟、LLM judge 偏置未消、只测开源模型、各模型推理时延如何折入时间轴未统一刻画。对照阅读:AOI/DynaCU-Bench(API 流式+真实 DOM 动作)、DuplexSLA(模型侧动作通道)、LivingScreen(屏幕演化+GUI 动作但回合制)。

🏷 关键词

omni-modalfull-duplexreal-time evaluationproactive reminderwhen-to-speakLLM-as-judgeMiniCPM-ostreaming videozero action