Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

OOD

Benchmarks

Task NameDataset NameSOTA ResultTrend
Out-of-Domain Reasoning AggregationOOD Average
Accuracy63.57
22
Speech Emotion RecognitionFour OOD (test)
Macro-F1 Delta1.57
21
Image ClassificationOOD 6 tasks (test)
Accuracy83.7
20
Speculative decoding evaluationOOD Mean
Speedup5.21
20
Out-of-Distribution DetectionOOD datasets
pAUROC@2094.2
17
Unsupervised Object SegmentationOOD 1.0 (test)
FG-ARI7,824
16
Agentic Model RoutingOOD n=176 (test)
Average Performance (%)75.89
14
LLM RoutingOOD
Accuracy89
11
Abdominal Aortic Aneurysm SegmentationOOD n = 26 (test)
DSC93.7
10
Uncertainty EstimationOOD Average across 8 domains
AUROC68.73
10
OOD DetectionOOD
AUC (Confidence)0.822
9
Mathematical and Scientific ReasoningOOD AIME, HMMT, GPQA, MMLU-Pro, MMLU-Redux 2.0
Pass@189.5
8
Language ModelingOOD
Loss1.285
7
Model RetrievalOOD datasets (test)
Average Target Accuracy55.6
6
Text-to-SQL generationOOD
Overall Match Accuracy40
6
Diffusion-generated time series detectionAvg. OOD Aggregate of TSDiff, Diffusion-TS, WaveStitch (summary)
F1 Score84.8
6
DetoxificationOOD
TP Score54
6
ClassificationOOD
Accuracy65.71
6
Speculative DecodingOOD
Block Efficiency2.13
5
Defective Dialog DetectionOOD Shopping n = 105 (test)
Precision48
5
Unsupervised image annotationOOD set
NMI0.54
5
Referential CommunicationOOD set
Accuracy92.7
5
Response Quality EvaluationOOD out-of-domain (150 samples)
Count102
4
Safe Robot NavigationOOD Case II: high obstacle density (30 obstacles)
SR44.2
4
Image DenoisingOOD Average
PSNR39.94
4
Showing 25 of 49 rows