Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

MergeBench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Multi-task Language ModelingMergeBench
Instruction Score39.56
21
Model Merging EvaluationMergeBench
MATH-500 Score52.6
12
Generative Language Model MergingMergeBench Expert models Llama-3.2-3B (test)
Instruction Score53.52
11
Multi-task Language UnderstandingMergeBench Llama-3.2-3B (test)
Average Score44.1
11
Vision-Language Multi-task PerformanceMergeBench (Vision-Language tasks: MMSI-Bench, EmbSpatial, MMMU_Med, PathVQA, OCRBench, CharXiv)
MMSI-Bench32.6
11
Showing 5 of 5 rows