Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Multi-document Question Answering on LongBench Multi-Doc QA v2
Loading...
60.3
Accuracy
DELM+RLM
20.052
30.501
40.95
51.399
Jun 9, 2026
Jun 12, 2026
Jun 16, 2026
Jun 20, 2026
Jun 23, 2026
Jun 27, 2026
Jul 1, 2026
Accuracy
Cost per Task
Latency (s)
Updated 23d ago
Evaluation Results
Method
Method
Links
Accuracy
Cost per Task
Latency (s)
DELM+RLM
Base Model=GPT-5
2026.06
60.3
0.24
-
DELM
Base Model=GPT-5
2026.06
57.9
0.3
-
RLM
Base Model=GPT-5, Sub-...
2026.06
55.8
0.29
-
MPLM
Backbone=Qwen3.6-35B-A3B
2026.07
47.2
-
104.2
RLM
Backbone=Qwen3.6-35B-A3B
2026.07
40
-
235.4
MPLM
Backbone=Qwen3-30B-A3B
2026.07
35
-
58.8
RLM
Backbone=Qwen3-30B-A3B
2026.07
21.6
-
104.8
Feedback
Search any
task
Search any
task