Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning

About

Audio generation and audio-to-text understanding remain largely separate, with diffusion models dominating high-fidelity synthesis and autoregressive (AR) language models driving captioning and semantic prediction. Existing unified approaches typically rely on either heterogeneous modules or AR-centric modeling, which can hinder joint optimization and limit acoustic fidelity. We present UAT, to our knowledge, the first diffusion-centric framework that supports unified audio generation, editing, and captioning. UAT couples continuous latent diffusion for audio with masked discrete diffusion for text, enabling bidirectional audio-text modeling within a shared dual-stream backbone. Experiments show that UAT preserves strong audio generation and editing capabilities while achieving competitive captioning performance, demonstrating a favorable balance between acoustic synthesis and semantic prediction. Demo samples are available at https://UAT-demo.github.io.

Hui Wang, Yifan Yang, Zeyue Tian, Yuhang Jia, Jinghua Zhao, Long Zhou, Bing Han, Cheng Liu, Jiaming Zhou, Geng Tu, Yong Qin• 2026

Related benchmarks

TaskDatasetResultRank
Audio CaptioningAudioCaps (test)
CIDEr0.406
222
Text-to-Audio GenerationAudioCaps (test)
KL Divergence1.39
213
Text-to-Audio GenerationVGGSound (test)
KL Divergence1.28
10
Audio EditingAuditScore-Bench Add (test)
CLAP Score0.406
6
Audio EditingAuditScore-Bench Replace (test)
CLAP Score0.439
6
Audio EditingAuditScore-Bench Delete (test)
CLAP0.35
6
Showing 6 of 6 rows

Other info

Follow for update