Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reasoning Correctness Evaluation on MATH
Loading...
0
Average FPR
Master-RM 7B
-3.508
20.171
43.85
67.529
Jul 11, 2025
Average FPR
FPR
Worst FPR
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average FPR
FPR
Worst FPR
Master-RM 7B
Response=Average | Worst
2025.07
0
-
0
Master-RM 32B
Response=Average | Worst
2025.07
0
-
0
Multi-sub RM
Response=Average | Worst
2025.07
0.1
-
0.3
GPT-o1
Response=Average | Worst
2025.07
6.3
-
15.2
General-Verifier
Response=Average | Worst
2025.07
13.8
-
66.8
GPT-4o
Response=Average | Worst
2025.07
17.5
-
42.6
Qwen2.5-7B
Response=Average | Worst
2025.07
22.1
-
31
Omni-Judge
Response=Average | Worst
2025.07
23.4
-
49.4
Claude-3.5
Response=Average | Worst
2025.07
25.6
-
57.7
Qwen2.5-72B
Response=Average | Worst
2025.07
78.7
-
88.6
LLaMA3-8B
Response=Average | Worst
2025.07
85.6
-
91.2
LLaMA3-70B
Response=Average | Worst
2025.07
87.7
-
92.4
Feedback
Search any
task
Search any
task