Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Harmful Refusal on AdvBench
Loading...
99.4
Refusal Rate (String Match)
LlamaGuard prompt-filter
12.248
34.874
57.5
80.126
Jun 10, 2026
Refusal Rate (String Match)
Updated 1mo ago
Evaluation Results
Method
Method
Links
Refusal Rate (String Match)
LlamaGuard prompt-filter
Draft Model=Llama-3.1-8B
2026.06
99.4
LlamaGuard response-filter
Draft Model=Llama-3.1-8B
2026.06
99.4
Hard prefix
Draft Model=Llama-3.1-...
2026.06
97.7
ALIGNBEAM
Draft Model=Llama-3.1-...
2026.06
94.4
Base draft
Draft Model=Llama-3.1-8B
2026.06
17.5
Safety prompt
Draft Model=Llama-3.1-8B
2026.06
15.6
Feedback
Search any
task
Search any
task