Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

In-distribution

Benchmarks

Task NameDataset NameSOTA ResultTrend
Harmfulness DetectionFull in-distribution (test)
AUROC0.964
63
Error DetectionIn-distribution (test)
AUC0.8916
40
Mathematical ReasoningIn-Distribution Avg
Average Score45.6
29
Visual GroundingIn-Distribution (test)
Accuracy99.7
18
Debiasing EffectivenessIn-Distribution (ID)
Mean Effectiveness Score (ID)10.2
16
Agentic Model RoutingIn-Distribution n=2,919 (test)
Average Performance (%)57
15
LLM NegotiationIn-distribution (held-out)
Reward0.58
13
Trajectory PredictionIn-distribution (InDist) (test)
ADE0.004
10
Object type predictionIn-Distribution (ID)
Accuracy (ID)100
9
Reasoning step reductionIn-Distribution 5K corpus (test)
Savings Rate47.5
9
Policy EvaluationIn-distribution
r Score98.4
8
Interactive SegmentationIn-distribution
NoC@90 Clicks1.95
6
Point TrackingIn-distribution
Avg Displacement Error57.4
6
Edge-selection fidelityin-distribution clean (test)
F1 Score53.4
5
Prompt Injection DetectionIn-distribution (ID) (test)
Macro F1 Score95.41
5
Text-to-SpeechIn-distribution ID (test)
MOS3.87
5
Metasurface inverse designIn-Distribution (test)
SG74
2
Showing 17 of 17 rows