Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Mathematical Reasoning on AMC 23 (Response Length (Tokens))
Loading...
6,768
Response Length (Tokens)
DeepSeek-R1-Distill
701.68
2,276.59
3,851.5
5,426.41
Jun 16, 2026
Response Length (Tokens)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Response Length (Tokens)
DeepSeek-R1-Distill
Model Scale=1.5B, Base...
2026.06
6,768
DeepSeek-R1-Distill
Model Scale=7B, Base M...
2026.06
5,466
AdaCoT
Model Scale=7B, Base M...
2026.06
3,115
S-GRPO
Model Scale=1.5B, Base...
2026.06
3,081
AdaCoT
Model Scale=1.5B, Base...
2026.06
2,936
AdaptThink
Model Scale=7B, Base M...
2026.06
2,834
AdaptThink
Model Scale=1.5B, Base...
2026.06
2,740
LHRMs
Model Scale=1.5B, Base...
2026.06
2,477
S-GRPO
Model Scale=7B, Base M...
2026.06
2,247
SuCo
Model Scale=1.5B, Base...
2026.06
1,687
LHRMs
Model Scale=7B, Base M...
2026.06
1,525
SuCo
Model Scale=7B, Base M...
2026.06
935
Feedback
Search any
task
Search any
task