| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Image-to-Text retrieval | DOCCI | R@191.3 | 66 | |
| Text-to-Image retrieval | DOCCI | Recall@193.4 | 66 | |
| Image-to-text retrieval | DOCCI (test) | Recall@195.9 | 43 | |
| Image Captioning | DOCCI 500 (test) | CAPTURE64.31 | 32 | |
| Text-to-Image Retrieval | DOCCI (val) | Recall@117.79 | 27 | |
| Image-to-Text Retrieval | DOCCI (val) | R@152.78 | 27 | |
| Long-caption Cross-modal Retrieval | DOCCI (test) | T2I Recall@181.12 | 16 | |
| Text-to-Image Retrieval | DOCCI (test) | R@179.04 | 12 | |
| Crossmodal retrieval | DOCCI | Recall@183.04 | 12 | |
| Text-to-Image Retrieval | DOCCI-CN | Recall@184 | 11 | |
| Image-to-Text Retrieval | DOCCI-CN | Recall@179.7 | 11 | |
| Zero-shot Image-Text Retrieval | DOCCI | Accuracy66.2 | 7 | |
| Image-to-text retrieval | DOCCI (full) | Recall@191.3 | 6 | |
| Image-Text Retrieval | DOCCI | Word Dropout (p=0.3)72.92 | 4 | |
| Text-to-image generation | DOCCI 500 random prompts (test) | FID Score24.52 | 3 |