Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

LLM benchmarks

Benchmarks

Task NameDataset NameSOTA ResultTrend
Language Model Reasoning and Knowledge Evaluation10 LLM Benchmarks suite (AIME25, AIME26, CEval, GPQA-D, HLE, IMO-AB, MMLU, MMLU-Pro, MMLU-Rd, MultiCh)
AIME 25 Score70
20
General Language UnderstandingLLM Benchmarks (ARC, HellaSwag, MMLU, TruthfulQA, Winogrande, GSM8K)
ARC Score55.55
9
Prompt Optimization42 LLM benchmarks Aggregate (overall)
Average Score67.14
5
Showing 3 of 3 rows