← 首页|学术|Benchmarking LLM Judges for Voice-Agent Evaluation: Do Text-Based Judges Miss What Matters?
cs.CL · 2608.24314 · 25 Aug 2026

Benchmarking LLM Judges for Voice-Agent Evaluation: Do Text-Based Judges Miss What Matters?

Voice-Agent Evaluation Lab et al.
💬 只读ASR转写文本的LLM裁判,在任务完成度上和人类打分吻合得挺好,但一到自然度和轮次交替质量就掉链子——干净的文本抹掉了停顿、插话和背景反馈这些"耳朵才听得出来"的信号。

🎯 问题

文本裁判可能听不出对话质量该有的东西
LLM-as-judge 评估越来越多地用于评测语音agent,但大多数裁判操作的是ASR转写文本而非原始音频,这可能会漏掉对对话质量至关重要的韵律、时序和轮次交替(turn-taking)现象。论文要问:文本裁判到底漏掉了多少?

🔬 方法

文本裁判 vs 音频原生裁判 vs 人类评分员三方对比
研究在一组涵盖任务完成、自然度、轮次交替质量等维度的语音agent对话上,系统性地对比了基于文本的LLM裁判、原生处理音频的裁判,与人类评分员的评分结果,逐维度分析各类裁判与人类评分的相关性差异,并做了错误分析,定位文本裁判具体漏掉了哪些现象。

📊 结果

文本裁判在任务完成度和内容正确性维度上与人类评分相关性良好,但在自然度和轮次交替质量维度上相关性明显下降;音频原生裁判能弥合与人类评分的差距,但并未完全弥合。错误分析显示,文本裁判系统性地漏掉了不流畅、背景反馈(backchannel)、不恰当的停顿时序——这些在干净转写文本里根本看不到,却是人类几乎不费力就能察觉的信号,说明纯转写文本评估流水线对语音agent的交互质量维度应谨慎对待。
语音AgentLLM裁判轮次交替评测基准对话自然度