Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Science Reasoning on GPQA Diamond (Response Length (Tokens))
Loading...
6,858
Response Length (Tokens)
DeepSeek-R1-Distill
1,170.24
2,646.87
4,123.5
5,600.13
Jun 16, 2026
Response Length (Tokens)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Response Length (Tokens)
DeepSeek-R1-Distill
Model Scale=7B, Base M...
2026.06
6,858
DeepSeek-R1-Distill
Model Scale=1.5B, Base...
2026.06
6,582
AdaCoT
Model Scale=7B, Base M...
2026.06
3,993
AdaptThink
Model Scale=7B, Base M...
2026.06
3,677
AdaCoT
Model Scale=1.5B, Base...
2026.06
3,279
AdaptThink
Model Scale=1.5B, Base...
2026.06
2,914
S-GRPO
Model Scale=1.5B, Base...
2026.06
2,828
S-GRPO
Model Scale=7B, Base M...
2026.06
2,453
LHRMs
Model Scale=1.5B, Base...
2026.06
2,381
LHRMs
Model Scale=7B, Base M...
2026.06
2,042
SuCo
Model Scale=1.5B, Base...
2026.06
1,550
SuCo
Model Scale=7B, Base M...
2026.06
1,389
Feedback
Search any
task
Search any
task