Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Image-Text-Audio

Benchmarks

Task NameDataset NameSOTA ResultTrend
(T+I)→A Cross-modal AlignmentImage-Text-Audio
CLAP Score46.96
16
(T+A)→I Cross-modal AlignmentImage-Text-Audio
CLIP Score30.76
16
(I+A)→T Cross-modal AlignmentImage-Text-Audio
CLIP Score29.97
16
Audio-to-Text GenerationImage-Text-Audio
CIDEr54.41
9
Text-to-Audio GenerationImage-Text-Audio
FAD2.47
9
Image-to-Text GenerationImage-Text-Audio
CIDEr91.36
9
Text-to-Image GenerationImage-Text-Audio
FID14.4
9
Audio-to-Image GenerationImage-Text-Audio
FID22.61
8
Image-to-Audio GenerationImage-Text-Audio
FAD1.9
8
Unconditional co-generationimage-text-audio
CLIP Score (Text-Image)26.76
5
Showing 10 of 10 rows