Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Long-form Question Answering on Long-form QA Datasets Average Clean RAG
Loading...
87.56
VeriScore F1@k
MIRAGE
69.9632
74.5316
79.1
83.6684
Jul 6, 2026
VeriScore F1@k
Updated 18d ago
Evaluation Results
Method
Method
Links
VeriScore F1@k
MIRAGE
Backbone=GPT-4o-mini
2026.07
87.56
RAG
Backbone=GPT-4o-mini
2026.07
85.32
MIRAGE
Backbone=Mistral-7B
2026.07
84.09
MIRAGE
Backbone=GPT-o1-mini
2026.07
83.57
RAG
Backbone=GPT-o1-mini
2026.07
82.69
RAG
Backbone=Mistral-7B
2026.07
82.15
MIRAGE
Backbone=Qwen2-7B
2026.07
78.45
MIRAGE
Backbone=LLaMA-3.1-8B
2026.07
76.36
RAG
Backbone=Qwen2-7B
2026.07
72.11
RAG
Backbone=LLaMA-3.1-8B
2026.07
70.64
Feedback
Search any
task
Search any
task