Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Mathematical Reasoning on LMB Hard
Loading...
46.2
Accuracy
Qwen2.5-32B-Instruct + Bootcamp-SFT-RL
5.328
15.939
26.55
37.161
Aug 12, 2025
Sep 30, 2025
Nov 18, 2025
Jan 7, 2026
Feb 25, 2026
Apr 15, 2026
Jun 4, 2026
Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Accuracy
Qwen2.5-32B-Instruct + Bootcamp-SFT-RL
Model=Qwen2.5-32B-Inst...
2025.08
46.2
DS-R1-Distilled-Qwen-32B + Bootcamp-RL
Model=DS-R1-Distilled-...
2025.08
43.7
DS-R1-Distilled-Qwen-32B
Model=DS-R1-Distilled-...
2025.08
36.8
Qwen2.5-32B-Instruct + Bootcamp-SFT
Model=Qwen2.5-32B-Inst...
2025.08
33.2
Qwen2.5-32B-Instruct
Model=Qwen2.5-32B-Inst...
2025.08
22
Qwen2.5-32B-Instruct + Bootcamp-RL
Model=Qwen2.5-32B-Inst...
2025.08
21.8
OPDLM-8B
Scale=8B, Tokens=0.066...
2026.06
20
OPDLM-4B
Scale=4B, Tokens=0.076...
2026.06
11.1
SDAR-8B
Scale=8B, Tokens=55B,...
2026.06
8.9
Fast-dLLM-v2-7B
Scale=8B, Tokens=1B, F...
2026.06
8.9
SDAR-4B
Scale=4B, Tokens=55B,...
2026.06
6.9
Feedback
Search any
task
Search any
task