| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| (T+I)→A Cross-modal Alignment | Image-Text-Audio | CLAP Score46.96 | 16 | |
| (T+A)→I Cross-modal Alignment | Image-Text-Audio | CLIP Score30.76 | 16 | |
| (I+A)→T Cross-modal Alignment | Image-Text-Audio | CLIP Score29.97 | 16 | |
| Audio-to-Text Generation | Image-Text-Audio | CIDEr54.41 | 9 | |
| Text-to-Audio Generation | Image-Text-Audio | FAD2.47 | 9 | |
| Image-to-Text Generation | Image-Text-Audio | CIDEr91.36 | 9 | |
| Text-to-Image Generation | Image-Text-Audio | FID14.4 | 9 | |
| Audio-to-Image Generation | Image-Text-Audio | FID22.61 | 8 | |
| Image-to-Audio Generation | Image-Text-Audio | FAD1.9 | 8 | |
| Unconditional co-generation | image-text-audio | CLIP Score (Text-Image)26.76 | 5 |