Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Code Generation on MBPP (Response Length Tokens)
Loading...
3,511
Response Length (Tokens)
DeepSeek-R1-Distill
826.76
1,523.63
2,220.5
2,917.37
Jun 16, 2026
Response Length (Tokens)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Response Length (Tokens)
DeepSeek-R1-Distill
Model Scale=1.5B, Base...
2026.06
3,511
DeepSeek-R1-Distill
Model Scale=7B, Base M...
2026.06
3,182
AdaCoT
Model Scale=1.5B, Base...
2026.06
1,720
LHRMs
Model Scale=7B, Base M...
2026.06
1,487
S-GRPO
Model Scale=1.5B, Base...
2026.06
1,481
AdaCoT
Model Scale=7B, Base M...
2026.06
1,423
AdaptThink
Model Scale=1.5B, Base...
2026.06
1,422
S-GRPO
Model Scale=7B, Base M...
2026.06
1,356
AdaptThink
Model Scale=7B, Base M...
2026.06
1,242
LHRMs
Model Scale=1.5B, Base...
2026.06
1,158
SuCo
Model Scale=7B, Base M...
2026.06
1,149
SuCo
Model Scale=1.5B, Base...
2026.06
930
Feedback
Search any
task
Search any
task