Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

HealthBench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Medical ReasoningHealthBench Hard
Accuracy40.74
41
Clinical Question AnsweringHealthBench (offline)
Accuracy31.79
38
Deep ResearchHealthBench
Score59.5
38
Medical Question AnsweringHealthBench Medicine N=5,000 (overall)
Rubric Score26.1
36
Medical ReasoningHealthBench
Accuracy70.41
36
Health-related dialogue and decision-makingHealthBench Main
Average Score46.38
24
Deep ResearchHealthBench ResearchQA DRB Macro Average
Average Score62.8
21
Medical Question AnsweringHealthBench Hard
Accuracy39.02
19
Reward AggregationHealthBench 500
Score65.7
18
Long-horizon agentic taskHealthbench Hard
Performance28.06
18
Medical and Health KnowledgeHealthBench
Accuracy37.2
17
Health DialogueHealthBench
Accuracy44.92
17
Medical Question AnsweringHealthBench Overall
Overall Score60.1
16
Medical Question AnsweringHealthBench held-out heart-related n=500 seed 42
Accuracy57
15
Health Multimodal EvaluationHealthBench English (test)
Overall Score32.7
15
Treatment planningHealthBench treatment-related conversations
Overall Score48.94
15
MedicalHealthBench-500
Score43.6
15
Medical Domain Question AnsweringHealthBench In-domain, Seen
Score22.97
14
Long-form researchHealthBench
Overall Score59.5
14
Medical Question AnsweringHealthBench Hard 1000
Accuracy86
12
Long-form deep-research answeringHealthBench
Score54
11
Open-ended Medical ConsultationHealthBench Hard
Total Score46.2
11
Clinical ReasoningHealthBench Professional (525 cases)
Overall Score62.72
11
Medical KnowledgeHealthBench
Pass@192.82
11
LLM EvaluationHealthBench (test)
HealthBench Score (%)62.6
11
Showing 25 of 58 rows