Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

SORRY-Bench

Benchmarks

Task NameDataset NameSOTA ResultTrend
Safety evaluationSorry-Bench
Safety Score99.09
90
Alignment Faking Rate MeasurementSORRY-BENCH
Alignment Faking Rate0.9
46
Safety AlignmentSORRY-Bench
ASR10.22
40
Safety EvaluationSORRY-Bench
Expected HFR0.9
35
Safety EvaluationSorry-Bench base
Safety Score92.73
27
Harmful Request DefenseSORRY-Bench
ASR13
24
Harmfulness EvaluationSORRY-Bench audio
ASR Accuracy78.41
15
Safety alignmentSORRY-Bench
Score85.7
14
Safety EvaluationSORRY-Bench
Compliance Rate26.9
12
Refusal ControlSORRY-Bench
Refusal Rate70.45
7
Safety ClassificationSorry-Bench (test)
Accepted HF Accuracy93.9
6
Harmful RefusalSorry-Bench
Refusal Rate (String Match)85.5
6
Safety EvaluationSorry-Bench
Ref %65.7
6
Harmful-request assistanceSORRY-Bench linguistic mutations
Compliance Rate25.4
6
Harmful-request assistanceSORRY-Bench decontaminated base prompts
Compliance Rate17.1
6
Showing 15 of 15 rows