Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Error Recognition on HotpotQA
Loading...
60.9
Top-1 Accuracy
CORRECT
12.852
25.326
37.8
50.274
Sep 28, 2025
Top-1 Accuracy
Top-3 Accuracy
Top-5 Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Top-1 Accuracy
Top-3 Accuracy
Top-5 Accuracy
CORRECT
Synthesized by=GPT-4o-...
2025.09
60.9
94.2
95.7
CORRECT
Synthesized by=GPT-5-Nano
2025.09
35.8
72.7
84.3
LLM-as-a-Judge
Synthesized by=GPT-4o-...
2025.09
34.8
59.4
63.8
Baseline
Synthesized by=GPT-5-Nano
2025.09
14.7
48.9
65.8
Feedback
Search any
task
Search any
task