Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

MM-MergeBench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Multimodal Generative TasksMM-MergeBench (test)
Accuracy56.65
12
Multi-modal Task EvaluationMM-MergeBench Seen Tasks
SciQA Score83.74
12
Multi-modal Task EvaluationMM-MergeBench Unseen Tasks
AVQA Score79.3
11
Vision-language model mergingMM-MergeBench seen tasks
Average Absolute Accuracy69.23
9
Vision-language model mergingMM-MergeBench unseen tasks
Average Absolute Accuracy39.84
8
Multi-task learning evaluationMM-MergeBench 20 tasks 1.0 (test)
Average Absolute Accuracy91.37
6
Multi-task learning evaluationMM-MergeBench 14 tasks 1.0 (test)
Average Absolute Accuracy90.88
6
Multi-task learning evaluationMM-MergeBench 8 tasks 1.0 (test)
Avg Absolute Accuracy92.83
6
Showing 8 of 8 rows