Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reasoning Correctness Evaluation on AIME 1983–2024
Loading...
0
Average False Positive Rate
Master-RM 7B
-3.564
20.493
44.55
68.607
Jul 11, 2025
Average False Positive Rate
False Positive Rate
Worst False Positive Rate
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average False Positive Rate
False Positive Rate
Worst False Positive Rate
Master-RM 7B
Response=Average | Worst
2025.07
0
-
0
Master-RM 32B
Response=Average | Worst
2025.07
0
-
0
Multi-sub RM
Response=Average | Worst
2025.07
0
-
0
GPT-o1
Response=Average | Worst
2025.07
0.4
-
1.4
GPT-4o
Response=Average | Worst
2025.07
3.6
-
15.3
Omni-Judge
Response=Average | Worst
2025.07
3.7
-
13.9
Qwen2.5-7B
Response=Average | Worst
2025.07
3.9
-
8.6
General-Verifier
Response=Average | Worst
2025.07
14.7
-
87
Claude-3.5
Response=Average | Worst
2025.07
28.2
-
56.2
Qwen2.5-72B
Response=Average | Worst
2025.07
54
-
90.9
LLaMA3-8B
Response=Average | Worst
2025.07
82
-
92
LLaMA3-70B
Response=Average | Worst
2025.07
89.1
-
95.1
Feedback
Search any
task
Search any
task