← 首页|学术|FireRedAudio: An Open Foundation Model for Unified Audio Understanding and Generation
eess.AS · 2608.24168 · 25 Aug 2026

FireRedAudio: An Open Foundation Model for Unified Audio Understanding and Generation

Audio Foundation Model Lab et al.
💬 用统一离散音频token在单一自回归架构里同时做理解与生成,FireRedAudio 证明了联合训练本身就能带来跨任务的能力涌现迁移。

🎯 问题

音频统一基础模型进展落后于文本、视觉
音频领域的理解任务(ASR、音频字幕、声音事件检测)与生成任务(TTS、音乐、音效)异质性很强,传统上分别由独立的专用模型处理,导致统一音频基础模型的进展明显落后于文本和视觉领域。

🔬 方法

统一离散音频token的单一自回归架构
FireRedAudio 是一个开放基础模型,训练语料涵盖语音、音乐和通用音频的大规模多样化语料,使用统一的离散音频token表示,在单一自回归架构内同时支持理解任务和生成任务,而非为两类任务分别搭建独立的模型或pipeline。

📊 结果

FireRedAudio 在 ASR、音频字幕、TTS 等基准上,相比开源模型取得有竞争力乃至最先进(SOTA)的结果,并展现出跨任务迁移的涌现能力——即在理解与生成任务上联合训练,相比用同样数据训练的任务专用基线,能同时提升两侧任务的表现。团队开源了模型权重与训练配方,支持后续开放研究。
音频基础模型统一理解与生成离散tokenASRTTS