Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

2WikiMHQA

Benchmarks

Task NameDataset NameSOTA ResultTrend
Multi-hop Question Answering2WikiMHQA
F1 Score85.56
85
Multi-hop Reasoning2WikiMHQA
AUROC0.7002
26
Multi-hop QA2WikiMHQA Wiki18 index (test)
Pass@455.1
20
Multi-hop Question Answering2WikiMHQA (test)
EM71.85
17
Multi-hop Question Answering2WikiMHQA in-distribution
Exact Match (EM)79.39
17
Question Answering2WikiMHQA (test)
EM45.8
14
Question Answering2WikiMHQA
Exact Match (EM)42.1
12
Multi-hop Question Answering2WikiMHQA
Query Latency (s/q)10.8
8
Multi-hop Question Answering2WikiMHQA 500 samples (test)
F1 Score91.1
8
Question Answering2WikiMHQA Covered Questions
Accuracy66.9
8
Question Answering2WikiMHQA All Questions
Accuracy61
8
Multi-hop Question Answering2WikiMHQA
EM37.8
7
Multi-hop QA2WikiMHQA
Average Violation0.56
4
Multi-hop Question Answering2WikiMHQA
GPT-Acc72.3
3
Question Answering2WikiMHQA
Accuracy71.2
2
Question Answering2WikiMHQA KET-RAG
Accuracy64.8
2
Knowledge Graph Question Answering2WikiMHQA strict (test)
Base Error0.592
1
Knowledge Graph Question Answering2WikiMHQA adaptive (test)
Base Error0.311
1
Uncertainty Quantification2WikiMHQA
Base Error0.311
1
Multi-hop Question Answering2WikiMHQA in-distribution v4 (test)
EM-
0
Showing 20 of 20 rows