Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

HLE

Benchmarks

Task NameDataset NameSOTA ResultTrend
Knowledge-Intensive ReasoningHLE
Avg Score85
75
Math ReasoningHLE Math-100
Pass@135.84
68
ReasoningHLE
Score64.7
65
ReasoningHLE
Accuracy (HLE Reasoning)40.8
63
Logical ReasoningHLE
Accuracy0.7226
62
Long-horizon agentic taskHLE
Performance60
41
Multimodal ReasoningHLE
Accuracy48.8
33
Mathematical ReasoningHLE Maths
Accuracy38.2
31
Scientific ReasoningHLE (test)
Pass@149
25
High-Level Expert Knowledge EvaluationHLE Gold 149
Accuracy (Bio)80.5
25
HLEHLE
Accuracy67.1
25
Hard Reasoning and Language EvaluationHLE
Accuracy54
25
Humanities Question AnsweringHLE
HLE Score13.37
24
General ReasoningHLE
Accuracy38.4
21
General and STEM reasoningHLE
Pass@18.12
20
ReasoningHLE
Head-to-head Win %100
20
Scientific ReasoningHLE
pass@1612
17
High-Level ReasoningHLE
Average Score26.6
17
Knowledge Question AnsweringHLE
Accuracy4.36
16
ReasoningHLE
Accuracy50.2
16
Mathematical reasoningHLE math
Accuracy23.3
16
Deep researchHLE
Accuracy51
16
Deep searchhle
Accuracy11.4
16
Textual long-horizon complex reasoningHLE Text
Score62
15
Web Agent Task CompletionHLE
Accuracy37.6
15
Showing 25 of 85 rows