Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

General Benchmarks

Benchmarks

Task NameDataset NameSOTA ResultTrend
General Language Understanding and ReasoningGeneral Benchmarks MMLU, HellaSwag, OBQA, WinoGrande, ARC-C, PiQA, SciQ, LogiQA
MMLU Accuracy35.68
70
General Language Understanding and ReasoningGeneral Benchmarks MMLU, CEval, CMMLU, HumanEval, MBPP, MATH, GSM8K, MultiArith, BBH
MMLU59.3
18
General Multimodal UnderstandingGeneral Benchmarks
Average Score74
12
General Language ModelingGeneral Benchmarks Llama 3.1 8B
Generation Quality Score66.5
11
Language ModelingGeneral Benchmarks (C-Eval, IFEval, MATH-500, LCB, H-Swag, SST-5, CrossNER) (test)
C-Eval Score80.2
6
General Multimodal ReasoningGeneral Benchmarks
Top-1 Accuracy57.8
6
Natural Language Understanding and ReasoningGeneral Benchmarks Italian
ARC-C-it37.47
6
General Capability PreservationGeneral Benchmarks Aggregated (test)
General Capability Score76.54
5
General ReasoningGeneral Benchmarks MMLU-R, MMLU-P, GPQA
MMLU-R (multi@5 Acc)92.3
4
General Language UnderstandingGeneral Benchmarks (MMLU, AlpacaEval, Arena-Hard)
MMLU Accuracy73.41
4
General Language Evaluation12 general benchmarks Avg
General Average Score68.24
3
Showing 11 of 11 rows