Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

Average across datasets

Benchmarks

Task NameDataset NameSOTA ResultTrend
Faithful CalibrationAverage across datasets (PQA, SA, SQA, HE, MMLU, SQ, MT, UM, AC, SG)
cMFG*0.85
27
Image ClassificationAverage across datasets
Base Score89.05
15
Disease diagnosisAverage across datasets
AUC89.11
15
Conformal Image ClassificationAverage across 11 datasets CLIP ViT-B/16 features (test)
Accuracy85.6
9
Image ClassificationAverage across 11 datasets (Aircraft, CIFAR10, CIFAR100, CUB200, DTD, Flower102, Food101, HAM10000, ImageNet, Resisc45, UCF101)
Avg ACC87.4
9
Time Series DenoisingAverage Across Datasets Scenario 3
RMSE0.0568
8
Time Series DenoisingAverage Across Datasets Scenario 2
RMSE0.0801
8
Time Series DenoisingAverage Across Datasets Scenario 1
RMSE0.0456
8
Average performance across 10 task typesAverage across 13 datasets (test)
Avg. Accuracy75.8
8
Text-image retrievalAverage across datasets
Speedup3.5
5
Depth CompletionAverage across datasets Hole
AbsREL1
4
Showing 11 of 11 rows