Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-form Question Answering on Long-form QA Datasets Average, Full Pollution
Loading...
78
VeriScore F1@k
MIRAGE
22.9944
37.2747
51.555
65.8353
Jul 6, 2026
VeriScore F1@k
Updated 18d ago
Evaluation Results
Method
Method
Links
VeriScore F1@k
MIRAGE
Backbone=GPT-4o-mini
2026.07
78
MIRAGE
Backbone=GPT-o1-mini
2026.07
73.7
MIRAGE
Backbone=Mistral-7B
2026.07
72.29
MIRAGE
Backbone=Qwen2-7B
2026.07
71.44
MIRAGE
Backbone=LLaMA-3.1-8B
2026.07
70.34
RAG
Backbone=GPT-4o-mini
2026.07
39.87
RAG
Backbone=GPT-o1-mini
2026.07
37.69
RAG
Backbone=Mistral-7B
2026.07
32.67
RAG
Backbone=Qwen2-7B
2026.07
30.89
RAG
Backbone=LLaMA-3.1-8B
2026.07
25.11
Feedback
Search any
task
Search any
task