Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Multimodal Autoregressive Pre-training of Large Vision Encoders

About

We introduce a novel method for pre-training of large-scale vision encoders. Building on recent advancements in autoregressive pre-training of vision models, we extend this framework to a multimodal setting, i.e., images and text. In this paper, we present AIMV2, a family of generalist vision encoders characterized by a straightforward pre-training process, scalability, and remarkable performance across a range of downstream tasks. This is achieved by pairing the vision encoder with a multimodal decoder that autoregressively generates raw image patches and text tokens. Our encoders excel not only in multimodal evaluations but also in vision benchmarks such as localization, grounding, and classification. Notably, our AIMV2-3B encoder achieves 89.5% accuracy on ImageNet-1k with a frozen trunk. Furthermore, AIMV2 consistently outperforms state-of-the-art contrastive models (e.g., CLIP, SigLIP) in multimodal image understanding across diverse settings.

Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor Guilherme Turrisi da Costa, Louis B\'ethune, Zhe Gan, Alexander T Toshev, Marcin Eichner, Moin Nabi, Yinfei Yang, Joshua M. Susskind, Alaaeldin El-Nouby• 2024

Related benchmarks

TaskDatasetResultRank
Object DetectionCOCO 2017 (val)
AP54
2930
Visual Question AnsweringTextVQA
Accuracy73.1
1455
Visual Question AnsweringGQA
Accuracy73.3
1445
Visual Question AnsweringVQA v2
Accuracy80.9
1429
Instance SegmentationCOCO 2017 (val)--
1304
Person Re-IdentificationMarket 1501
mAP83.71
1136
Science Question AnsweringScienceQA
Accuracy77.3
916
Image ClassificationStanford Cars--
705
Semantic segmentationADE20K
mIoU37.9
699
Visual Question AnsweringChartQA
Accuracy72.5
620
Showing 10 of 108 rows
...

Other info

Code

Follow for update