Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-form Question Answering on Long-form QA Datasets Average, Mixed Pollution
Loading...
83.43
VeriScore F1@k
MIRAGE
40.0412
51.3056
62.57
73.8344
Jul 6, 2026
VeriScore F1@k
Updated 18d ago
Evaluation Results
Method
Method
Links
VeriScore F1@k
MIRAGE
Backbone=GPT-4o-mini
2026.07
83.43
MIRAGE
Backbone=GPT-o1-mini
2026.07
80.52
MIRAGE
Backbone=Qwen2-7B
2026.07
74.96
MIRAGE
Backbone=Mistral-7B
2026.07
74.87
MIRAGE
Backbone=LLaMA-3.1-8B
2026.07
71.91
RAG
Backbone=GPT-o1-mini
2026.07
54.4
RAG
Backbone=GPT-4o-mini
2026.07
53.88
RAG
Backbone=Qwen2-7B
2026.07
46.64
RAG
Backbone=Mistral-7B
2026.07
45.12
RAG
Backbone=LLaMA-3.1-8B
2026.07
41.71
Feedback
Search any
task
Search any
task