Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Multi-task Category-level Evaluation Suite

Benchmarks

Task NameDataset NameSOTA ResultTrend
Multi-task Model MergingMulti-task Category-level Evaluation Suite (Instruction Following, Math, Multilingual, Safety)
Average Score93.5
9
Multi-task Model Merging EvaluationMulti-task Category-level Evaluation Suite Qwen-3-4B
Average Score1.18
9
Showing 2 of 2 rows