Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
General Reasoning on AIME 2025 (Accuracy)
Loading...
80.1
Accuracy (%)
TeamTR (Heterogeneous)
5.948
25.199
44.45
63.701
May 1, 2026
Accuracy (%)
Updated 2mo ago
Evaluation Results
Method
Method
Links
Accuracy (%)
TeamTR (Heterogeneous)
Size=1.7B+8B+14B
2026.05
80.1
TeamTR (Homogeneous)
Size=3×8B
2026.05
78.3
o4-mini
Size=–
2026.05
74.8
Qwen3 (thinking)
Size=32B
2026.05
72.9
Qwen3-A3B
Size=30B
2026.05
70.9
QwQ
Size=32B
2026.05
69.5
Debate + Judge
Size=3×8B
2026.05
61.7
Role-play
Size=3×8B
2026.05
60.5
Debate
Size=3×8B
2026.05
59.1
DeepSeek-R1 Distill
Size=70B
2026.05
56.3
DAPO
Size=8B
2026.05
30.1
GRPO
Size=8B
2026.05
27.9
GPT-4o-mini
Size=–
2026.05
8.8
Feedback
Search any
task
Search any
task