Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

LongReason

Benchmarks

Task NameDataset NameSOTA ResultTrend
Long-context ReasoningLongReason Average across 16k-64k
Accuracy54.2
36
Long-context ReasoningLongReason 64k prefill length
Accuracy53.02
36
Long-context ReasoningLongReason 32k prefill length
Accuracy53.9
36
Long-context ReasoningLongReason 16k prefill length 1.0 (test)
Accuracy55.67
36
Long-context reasoningLongReason 64K-input 70K context
Accuracy71.25
34
Long-context reasoningLongReason
Accuracy (32K Context)86.6
21
Long-context reasoningLongReason
Score86.9
18
Multi-choice reasoningLongReason
Accuracy (32k)84.13
17
Question AnsweringLongReason
Acc72.3
15
Synthetic Long-context ReasoningLongReason
Accuracy84.89
12
RL TrainingLongReason
Peak Memory (GB)80
6
ReasoningLongReason (val)
Accuracy (val)79.3
4
Showing 12 of 12 rows