Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Jailbreak Detection on AdvBench Llama3-8B
Loading...
0.967
AUROC
GradSafe
0.317
0.48575
0.6545
0.82325
Jun 5, 2026
AUROC
Updated 1mo ago
Evaluation Results
Method
Method
Links
AUROC
GradSafe
Attack=AutoDAN
2026.06
0.967
MTK
Attack=AutoDAN
2026.06
0.961
SmoothLLM
Attack=AutoDAN
2026.06
0.952
SelfDefend
Attack=AutoDAN
2026.06
0.945
MTK
Attack=Avg.
2026.06
0.944
SelfDefend
Attack=Avg.
2026.06
0.837
SmoothLLM
Attack=Avg.
2026.06
0.814
HiddenDetect
Attack=AutoDAN
2026.06
0.722
HSF
Attack=AutoDAN
2026.06
0.696
GradSafe
Attack=Avg.
2026.06
0.632
HSF
Attack=Avg.
2026.06
0.631
SaP
Attack=Avg.
2026.06
0.625
SaP
Attack=AutoDAN
2026.06
0.598
HiddenDetect
Attack=Avg.
2026.06
0.584
GradCuff
Attack=Avg.
2026.06
0.432
GradCuff
Attack=AutoDAN
2026.06
0.342
Feedback
Search any
task
Search any
task