← 首页|学术|精读:全双工语音对话系统综述 — 架构层级 / 交互本体 / 决策状态机
eess.AS · 2606.19453 · 17 Jun 2026 · 浙江大学 / 阿里巴巴 等(18位作者)

A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine

Jingyu Lu, Yuhan Wang, Jianming Luo, Yifu Chen, Tianle Liang, Shengpeng Ji, Ziyue Jiang, Xiaoda Yang, Yu Zhang, Xize Cheng, Chenyuhao Wen, Changhao Pan, Haoxiao Wang, Chen Ye, Jian Wu, Xiaoxi Jiang, Guanjun Jiang, Zhou Zhao
全双工语音 综述 Turn-Taking 分类框架 DuplexOmni 线相关
核心主张:十几个系统都自称"全双工",但这个词描述的能力天差地别。作者认为现有综述把它们塞进单一轴线(级联/端到端,或工程化/学习式)是分类学上的偷懒——真正重要的是三件独立的事:双工决策在模型栈的哪个位置发生(L0-L3 架构层级)、支持哪些交互类型(T×I×R 交互本体)、系统在时刻尺度上如何在状态间转移(IDLE/LISTEN/SPEAK/WAIT/DUAL 决策状态机)。用这套框架审计已发表系统后发现一个"实现差距":很多架构原则上能支持全双工状态,但训练/评测数据的覆盖不足让它们的实际表现被锁死在更窄的交互模式里。
  1. 问题定义:为什么"full-duplex"这个词不够用
  2. 框架一:L0-L3 架构层级
  3. 框架二:T×I×R 交互本体
  4. 框架三:决策状态机
  5. 实现差距:跨系统审计发现
  6. 公开数据 vs 工业语料的结构性不对称
  7. L3 表征级建模:尚未实现的目标
  8. 基准现状与缺口
  9. 对既有综述的批评
  10. 与 DuplexOmni / DuplexPO 的关联定位
  11. 总体判断 & 可借鉴点

🎯 问题定义:为什么"full-duplex"这个词不够用

现象:术语滥用掩盖了真实的能力差异
十几个近期系统都声称"全双工",但这个标签下的实际能力千差万别——有的系统只是能被打断,有的能做实时 backchannel,有的能处理第三方噪声,有的能同时说和听但决策仍然是逐块(chunk)而非逐 token。既有综述把这些系统压缩到单一分类轴上(级联式 vs 端到端式,或工程化 vs 学习式),丢失了对建构者最关键的区分信息:双工决策具体在哪里发生、支持哪些交互类型、系统如何随时间在状态间转移
论文的核心论点:全双工行为是"架构能力覆盖范围 + 训练数据覆盖范围 + 逐时刻策略"三者的联合产物,而不是单一特性——这意味着近乎相同的解码器架构,因训练数据不同,可以支持完全不同的交互覆盖范围。这直接呼应了 DuplexPO(2607.07148)里"SFT on 对话数据≠改善 turn-taking"的核心发现:架构相同不代表行为相同,数据和训练目标才是决定性变量。

🏗️ 框架一:L0-L3 架构层级

这个框架回答"双工决策在模型栈的哪一层被做出"。四个层级:
层级决策位置代表系统
L0
模块级
LLM 外部的调度器(VAD + 话轮结束分类器 + 对话管理器),决策完全在语言模型之外FireRedChat, FlexDuo, X-Talk, SoulX-Duplug, Easy Turn, FastTurn
L1
隐藏状态级
外部模块读取 LLM 的隐藏状态来做决策,比 L0 更深入但仍是"读取+决策"的两段式MinMo, Freeze-Omni(自称FD);Qwen2.5/3.5-Omni Thinker-Talker, Step-Audio R1.1(结构相同但不自称FD)
L2
Token级
双工决策直接嵌入 token 生成过程本身,没有独立的外部模块Moshi, LSLM, OmniFlatten, SyncLLM, Mini-Omni/2, Fun-Audio-Chat, Covo-Audio, DuplexMamba, SALMONN-omni;GLM-4-Voice结构相同但不自称FD
L3
表征级
用户/助手两条流共享一个连续隐空间的假设架构尚无已发表系统实现
值得注意的观察:L1 被称为一种"结构吸引子"(structural attractor)——独立团队为了不同目的(有的为了做全双工,有的单纯为了做统一的听说架构如 Qwen-Omni)都收敛到了同一种"外部模块读隐藏状态"的形状,说明这是当前技术条件下一个自然的局部最优解,而非刻意设计的双工方案。

🔀 框架二:T×I×R 交互本体

一个全双工"时刻"被刻画为三元组:T(时序关系)× I(用户意图)× R(系统所需响应)。论文识别出六个"试金石单元格"(acid-test cells),用来区分真正的全双工行为和伪装成全双工的半双工行为:
这套三轴分解的价值在于:能明确区分"系统在架构上支持某类交互"和"系统在训练数据里实际见过并学会了处理某类交互"——很多系统在 T×I×R 网格上留有大片未被验证甚至未被训练覆盖的空白格。

⚙️ 框架三:决策状态机

五个状态:Idle(空闲)/ Listen(倾听)/ Speak(说话)/ Wait(等待)/ Dual(双工,同时说和听),共十一种状态转移。
FlexDuo 被认为率先引入了显式的 Idle 状态——作为助手说完话后进入的一个缓冲态,避免立即触发下一轮决策造成误判。论文给出了几类典型交互模式对应的状态轨迹:标准话轮转移(所有系统都能实现)、犹豫处理(MinMo)、合作式打断(Moshi)、说话中的 backchannel(OmniFlatten)、第三方语音处理(FireRedChat)。
关键发现:"持续并发"(sustained concurrent,即双方长时间真正同时说话且都在被理解处理)是目前没有任何系统真正实现的状态——这是全双工能力光谱上最难的一格,也是当前所有系统的共同短板。

📊 实现差距:跨系统审计发现

"实现差距"(Realization Gap)定义
架构原则上能支持的全双工状态,与训练/评测数据实际让它展现出的行为之间的距离。论文给出了具体的实测数字:
系统关键指标
FireRedChat话轮结束(EoT)准确率中文 ~96%,英文 ~95%;打断响应 T90≈170ms;端到首响应 P50≈2.34s,P95≈3.02s
MinMo全双工延迟理论约600ms,实际约800ms;训练于4000小时对话混合语料
Moshi延迟理论160ms,实际约200ms;预训练约700万小时音频,在 Fisher 语料上微调
SyncLLM被明确标记为"L2形态但只是表面(apparent)而非实质(substantive)"的全双工系统——因为其决策只在块(chunk)边界发生,而非真正逐 token
这一区分——"表面双工"(apparent)vs"实质双工"(substantive)——是本文最锋利的批判工具:仅凭架构类型(如声称是L2 token级)无法判断系统是否真的具备细粒度双工能力,必须结合决策粒度的实测才能判断。

🗂️ 公开数据 vs 工业语料的结构性不对称

论文提出"双轨结构性不对称":Track A(公开语料,覆盖有限)vs Track B(工业专有语料,基本不公开)。Moshi 使用 Fisher 语料、MinMo 使用4000小时混合语料是仅有的两个有据可查的数据点;其余工业系统的数据配方基本不透明。
作者将这一数据不对称视为解释"架构相似但跨系统行为差异巨大"现象的关键原因——这与 DuplexPO 论文中"Fisher 语料本身是无目标导向闲聊,会稀释推理能力"的观察形成呼应:语料本身的性质(覆盖哪些交互模式、任务导向程度)比架构选择对最终行为的影响更大,但这部分信息恰恰是最不透明的。

🔮 L3 表征级建模:尚未实现的目标

三个障碍
论文提出三个可能的实现路径假说:(1) 连续隐空间自回归流式生成;(2) JEPA 风格的双流预测;(3) 世界模型条件化对话。这三个方向都还处于推测阶段,没有已发表的实现。

📏 基准现状与缺口

论文指出一个容易被忽视的混乱:存在两个同时活跃、名称相似的基准系列(FDB 与 FD-Bench 系列),经常被读者混淆。结构性缺口包括:静态测试集 vs 自适应交互场景的缺失、语言/声学多样性有限、以及缺少显式的"表面 vs 实质"双工探针——即当前基准大多只能测出系统"是否给出了正确响应",测不出这个响应是靠细粒度逐token决策还是靠块级近似拼凑出来的。

⚔️ 对既有综述的批评

论文点名批评了两篇既有综述:WavChat 被认为采用"级联/端到端二分"把全双工当作二元属性来处理;Chen & Yu 综述被认为采用"工程化 vs 学习式"单一轴线。两者的共同问题是:都没有回答决策发生在哪里、支持哪些交互类型、系统在时刻尺度上如何行为——这正是本文三个框架分别要填补的三个空白。

🔗 与 DuplexOmni / DuplexPO 的关联定位

这篇综述没有覆盖 DuplexOmni,但可以用它的框架反推定位
DuplexOmni(2606.09186)的核心架构是 Interaction Layer + Thinking Layer 的两层异步设计——Interaction Layer 负责实时听说决策,Thinking Layer 异步做深度推理。这个设计不完全落在本文 L0-L3 任何一格里:它比 L1(外部模块读隐藏状态)更进一步做了显式的双层解耦和异步流水线,但又没有达到 L3(共享连续隐空间)的程度——更准确地说,它是L1 思路的一种深化和体系化实现,用显式的 480ms 时间片和控制 token 机制替代了本文里"外部模块+隐藏状态读取"的松散耦合。
DuplexPO(2607.07148)则完全落在本文的"数据/训练"维度而非架构维度——它证明了"架构相同(都是 L1/L2 形态),仅靠改变训练目标(RL 只优化时序决策而非语义内容)就能大幅改善交互覆盖范围",这正好印证了本综述"全双工行为是架构+数据+策略联合产物"的核心论点,且是三者中"策略/训练"这一维度上最扎实的实证案例。
对 duplex agent 研究方向的启发:本综述提供的 T×I×R 网格和"表面 vs 实质"双工区分,可以直接用作评估任何新 duplex 架构(包括未来的 DuplexOmni 后续工作)的诊断工具——不应止步于"能否被打断"这类粗粒度测试,而应系统性地在六个试金石单元格上逐一验证,并测量决策粒度(逐token还是逐块)以判断是表面还是实质双工。

🏁 总体判断 & 可借鉴点

总体判断
这是一篇分类学导向的综述,价值不在提出新架构或新算法,而在提供了一套之前缺失的、可操作的诊断词汇——"决策发生在哪一层""覆盖哪些交互类型""表面双工 vs 实质双工"。这套词汇本身就是一种研究贡献:它让"全双工"这个含糊标签变得可审计、可比较,并揭示了当前几乎所有系统共同的短板(持续并发状态、L3表征级建模均未实现)。18位作者、34页篇幅、对十几个系统逐一定位,覆盖广度扎实。
分类框架价值高duplex agent 必读工程实现细节较薄
可借鉴点 1:架构层级(L0-L3)是设计新系统时的自我定位工具
在设计任何新的实时交互系统时,先明确"决策发生在哪一层"能帮助识别当前设计的天花板——例如选择 L0/L1 意味着接受"两段式"的固有延迟,选择 L2 意味着需要承担更复杂的联合训练但换来更细粒度的决策能力。
可借鉴点 2:"表面 vs 实质"区分应成为评测新系统的默认检验项
仅凭"支持打断/backchannel"等功能清单无法判断系统的双工能力是否扎实,必须检验决策粒度(是否真的逐token/逐帧决策,还是块级近似)。这对任何自称"实时"或"低延迟"的 agent 系统同样适用——功能存在不代表机制扎实。
可借鉴点 3:T×I×R 网格可迁移为交互覆盖率的系统性测试清单
六个试金石单元格提供了一个可直接套用的最小测试集模板——对任何新 duplex/interactive 系统,可以先用这六类场景做冒烟测试,快速定位在 T×I×R 网格上的覆盖空白,而不必等到完整基准跑通才发现系统性缺陷。
值得追踪的开放问题
来源:arXiv:2606.19453v1 · 2026-06-17 · Jingyu Lu et al. · 相关材料见论文提供的项目页面