← 首页|学术|τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains
arXiv ↗
cs.CL / eess.AS 2603.13686

τ-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains

Sierra (τ-bench 原班人马)
ICML 2026 poster · arXiv 2603.13686 · Mar 2026
💬  τ²-bench 278 个客服任务原封接上全双工语音:tick 编排器(200ms)+ audio-time 与墙钟解耦;干净语音 31–51% vs 文本 GPT-5 85%、现实条件 26–38%——语音通道税吃掉过半任务能力;解耦机制本身是语音域现成的调速旋钮。

🔧 tick 编排与解耦

音频离散成 200ms tick、每 tick 双方各交换恰好 τ ms 音频;关键:被测 API 按 audio timestamps 而非墙钟索引事件——仿真时间与墙钟解耦。

原文:'audio can be sent faster or slower than real-time and the API processes it according to audio timestamps'。解耦用途:用户模拟器可用最强 LLM 不受实时约束地做打断/backchannel 决策;打断时清 buffer 截断进行中回复;重叠语音线性化喂模拟器;给定 seed 全确定可复现。

音频环境全参数化:背景噪声 SNR+漂移、burst 噪声(电话铃/狗叫)、G.711 μ-law 8kHz 电话压缩、Gilbert-Elliott 丢帧模型、动态 muffling、口音/语速 persona、非面向 agent 的语音('hold on')、vocal tics(咳嗽)。时序参数全部可配置:静默阈值、打断检查间隔、让位时机——比 FDB-v2 的实时流式方案控制粒度更细(作者自己对比)。

📊 结果

Clean 31–51% vs 文本 GPT-5 (reasoning) 85%;Realistic(噪声+口音+turn-taking)26–38%,仅保留文本能力 30–45%;79–90% 失败归因于 agent 行为。

口音是最伤因素且厂商特异:xAI 掉 38% 而 Google 几乎不受影响。厂商三角:Google 最抗降级(掉 17% vs others 24–28%);OpenAI 延迟最快(0.90s)响应率近 100% 但选择性最差(6%,什么都接话);xAI 任务完成略领先(51%/38%)但打断率 84% 最高。没有厂商同时掌握任务完成与会话动态。

评测双轨:pass@1 沿用 τ²(终态数据库比对 + 口头承诺用 LLM 验证以容忍口语变体)+ 四维会话质量(responsiveness/latency/interrupt rate/selectivity)。三域 278 任务:Retail 114(主域,slot filling 密集——名字/邮箱/订单号是端到端语音已知弱点)/ Airline 50 / Telecom 114。

💡 对主线的启示

audio-time 解耦=语音域现成的调速旋钮:以 N 倍速喂音频即环境时钟加速,被测 API 无感——变速重跑零改造可行,但论文自己没做阶梯。

划界:它自述与墙钟解耦,测'会话动态×任务完成'不测'墙钟压力下的成败';引 31–51% vs 85% 时说明是通道税不是时延税。协议件可抄:tick 交换、失败人工归因流程、LLM 验证口头承诺。

对我们最有价值的是它证明了三大 realtime API 的事件索引都在 audio-time 上——这是调速阶梯在语音域的协议基础(团队估计变速重跑 FDB v1/1.5 为最便宜入口,τ-Voice 的任务完成型载体是第二档)。局限:三域全客服无视觉/GUI;用户模拟器上限即评测上限;realistic 音频仍是合成混音。对照:DuplexSLA(模型侧动作通道)、Gaia2(时间敏感 API 宇宙)、FDB 系(纯会话动态)。

🏷 关键词

full-duplex voicetask completiontick orchestratoraudio-time decouplingtau-benchturn-takingaccentspass@1SierraICML 2026