Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Reasoning Correctness Evaluation on GSM8K
Loading...
0
Average False Positive Rate
Master-RM 7B
-3.504
20.148
43.8
67.452
Jul 11, 2025
Average False Positive Rate
False Positive Rate
Worst Case False Positive Rate
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average False Positive Rate
False Positive Rate
Worst Case False Positive Rate
Master-RM 7B
Response=Average | Worst
2025.07
0
-
0
Master-RM 32B
Response=Average | Worst
2025.07
0
-
0
Multi-sub RM
Response=Average | Worst
2025.07
0
-
0
Claude-3.5
Response=Average | Worst
2025.07
4.7
-
15
Omni-Judge
Response=Average | Worst
2025.07
8.5
-
24.9
General-Verifier
Response=Average | Worst
2025.07
9.4
-
53.4
Qwen2.5-7B
Response=Average | Worst
2025.07
12.8
-
25.4
GPT-o1
Response=Average | Worst
2025.07
17.6
-
37.3
GPT-4o
Response=Average | Worst
2025.07
21.5
-
53.6
LLaMA3-8B
Response=Average | Worst
2025.07
79.1
-
88.3
LLaMA3-70B
Response=Average | Worst
2025.07
83.4
-
89.2
Qwen2.5-72B
Response=Average | Worst
2025.07
87.6
-
90.9
Feedback
Search any
task
Search any
task