Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Average QA and Reasoning on NQ, TriviaQA, HotpotQA, and GSM8K
Loading...
72.5
Average Accuracy
Kite-best
58.564
62.182
65.8
69.418
Sep 19, 2025
Average Accuracy
Updated 1mo ago
Evaluation Results
Method
Method
Links
Average Accuracy
Kite-best
Model=GPT-4.1, Exempla...
2025.09
72.5
DPP-best
Model=GPT-4.1, Exempla...
2025.09
71.7
KNN-best
Model=GPT-4.1, Exempla...
2025.09
71.5
BM25
Model=GPT-4.1, Exempla...
2025.09
71.2
Kite-best
Model=GPT-5.2, Exempla...
2025.09
71
DPP-best
Model=GPT-5.2, Exempla...
2025.09
70.1
KNN-best
Model=GPT-5.2, Exempla...
2025.09
69.8
BM25
Model=GPT-5.2, Exempla...
2025.09
68.2
Kite-best
Model=GPT-4o-mini, Exe...
2025.09
65.3
KNN-best
Model=GPT-4o-mini, Exe...
2025.09
65.1
DPP-best
Model=GPT-4o-mini, Exe...
2025.09
65.1
BM25
Model=GPT-4o-mini, Exe...
2025.09
64.1
Kite-best
Model=Claude-Haiku-4.5...
2025.09
62.1
DPP-best
Model=Claude-Haiku-4.5...
2025.09
61
KNN-best
Model=Claude-Haiku-4.5...
2025.09
60.3
BM25
Model=Claude-Haiku-4.5...
2025.09
59.1
Feedback
Search any
task
Search any
task