Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

DeepResearch Bench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Deep Research Report GenerationDeepResearch Bench
Comprehensiveness52.84
89
Deep ResearchDeepResearch Bench official 100-task-subset 1.0
RACE Overall0.5076
24
Report-generationDeepResearch Bench
Overall Score48.27
20
Report GenerationDeepResearch Bench 2025 (test)
Comprehensiveness49.5
16
Deep ResearchDeepResearch Bench (test)
Comprehensiveness56.28
14
Deep ResearchDeepResearch Bench II
Information Recall57.58
13
Deep ResearchDeepResearch Bench 1.0 (test)
Overall Score46.45
12
Open-Ended Deep ResearchDeepResearch Bench Open-Ended
Overall Score52.09
11
Open-ended deep research evaluationDeepResearch Bench 100 PhD-level research tasks
Comprehensiveness54.25
9
Report SynthesisDeepResearch Bench (DRB)
Score50.6
8
Research Report GenerationDeepResearch Bench RACE framework 1.0 (test)
Overall Score49.71
7
Planning-layer poisoning attackDeepResearch Bench stratified 10-query subset 1.0
PRISM38.5
6
Clarification GenerationDeepResearch Bench online interactive settings
Intent Precision36.44
6
Defense against planning-layer poisoningDeepResearch Bench 10-query
PRISM (%)38.5
5
Human EvaluationDeepResearch Bench 20 reports (sampled)
Readability (Win/Tie Rate)95
5
Clarification GenerationDeepResearch Bench offline (test)
Quality Score2.43
4
Multi-turn RefinementDeepResearch Bench 100 follow-up instances
Instance Score15.35
3
Showing 17 of 17 rows