Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Retrieval-Augmented Question Answering on Composite-9
Loading...
94.4
Correctness
Custom ReAct
42.4
55.9
69.4
82.9
Jun 9, 2026
Correctness
Faithfulness
Latency (p50, s)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Correctness
Faithfulness
Latency (p50, s)
Custom ReAct
Base Model=Qwen-2.5-7B
2026.06
94.4
78
4.48
Monolithic
Base Model=Qwen-2.5-7B
2026.06
90
76
1.94
Regex-Scoped
Base Model=Qwen-2.5-7B
2026.06
90
80
2.64
HYBRID-ROUTED
Base Model=Qwen-2.5-7B
2026.06
85.7
77
2.86
ColBERTv2 scoped + Qwen
Base Model=Qwen-2.5-7B
2026.06
84
86
2.62
ColBERTv2 + Qwen
Base Model=Qwen-2.5-7B
2026.06
82
78
1.8
MASDR-RAG
Base Model=Qwen-2.5-7B
2026.06
74
74
3.12
BM25 + Qwen
Base Model=Qwen-2.5-7B
2026.06
74
58
1.74
SCOUT-RAG
Base Model=Qwen-2.5-7B
2026.06
66.7
-
23.6
MA-RAG
Base Model=Qwen-2.5-7B
2026.06
44.4
-
17.7
Feedback
Search any
task
Search any
task