AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

About

Audiovisual video captioning aims to generate semantically rich descriptions with temporal alignment between visual and auditory events, thereby benefiting both video understanding and generation. In this paper, we present AVoCaDO, a powerful audiovisual video captioner driven by the temporal orchestration between audio and visual modalities. We propose a two-stage post-training pipeline: (1) AVoCaDO SFT, which fine-tunes the model on a newly curated dataset of 107K high-quality, temporally-aligned audiovisual captions; and (2) AVoCaDO GRPO, which leverages tailored reward functions to further enhance temporal coherence and dialogue accuracy while regularizing caption length and reducing collapse. Experimental results demonstrate that AVoCaDO significantly outperforms existing open-source models across four audiovisual video captioning benchmarks, and also achieves competitive performance on the VDC and DREAM-1K benchmark under visual-only settings.

Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan• 2025

Related benchmarks

Task	Dataset	Result
Audio-visual understanding	DailyOmni	Average Score69.8	101
Audio-visual understanding	WorldSense	Accuracy49.9	72
Audiovisual Video Captioning	SALMONN 2 (test)	Miss Rate21.1	37
Video Captioning	VDC	Short Accuracy27.1	35
Audiovisual Video Captioning	UGC-VideoCap	Audio Score73	34
Audiovisual Understanding & Reasoning	Daily-Omni	Score55.72	33
Audio-visual understanding	Video-MME	Score65.9	15
Audiovisual Dialogue Description	DiaDemBench	REF38.7	15
Audiovisual Understanding & Reasoning	World-Sense	Score35.31	14
QA performance by Gemini-2.5-Pro based on captions	Daily-Omni (test)	Daily-Omni QA Score50.1	13

Showing 10 of 18 rows

Other info

GitHub

Follow for update

@wizwand_team Discord