Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Active Reasoning on ARBench SP
Loading...
43.1
Accuracy
o4-mini
34.884
37.017
39.15
41.283
May 1, 2026
Accuracy
Updated 2mo ago
Evaluation Results
Method
Method
Links
Accuracy
o4-mini
Size=–
2026.05
43.1
TeamTR (Homogeneous)
Size=3×8B
2026.05
43.1
TeamTR (Heterogeneous)
Size=1.7B+8B+14B
2026.05
42.3
GPT-4o-mini
Size=–
2026.05
40.8
Debate + Judge
Size=3×8B
2026.05
39.4
Qwen3 (thinking)
Size=32B
2026.05
38.9
Role-play
Size=3×8B
2026.05
38.7
Qwen3-A3B
Size=30B
2026.05
38.4
Debate
Size=3×8B
2026.05
38
QwQ
Size=32B
2026.05
36.1
DAPO
Size=8B
2026.05
35.9
DeepSeek-R1 Distill
Size=70B
2026.05
35.4
GRPO
Size=8B
2026.05
35.2
Feedback
Search any
task
Search any
task