Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Jailbreak Attack Evaluation on AdvBench-X Swahili multilingual (test)
Loading...
1.34
ASR (OpenAI Moderation)
Trajectory-Level Safety Alignment
0.9484
3.5917
6.235
8.8783
Jun 3, 2026
ASR (OpenAI Moderation)
ASR (LlamaGuard)
Updated 1mo ago
Evaluation Results
Method
Method
Links
ASR (OpenAI Moderation)
ASR (LlamaGuard)
Trajectory-Level Safety Alignment
Condition=Injection, B...
2026.06
1.34
0.19
Llama-3.1-8B-Instruct
Condition=No Attack
2026.06
6.14
3.65
Llama-3.1-8B-Instruct
Condition=Injection (n...
2026.06
11.13
8.83
Feedback
Search any
task
Search any
task