Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Jailbreak Attack Evaluation on AdvBench-X Korean multilingual (test)
Loading...
5.19
ASR (OpenAI Moderation)
Trajectory-Level Safety Alignment
3.9436
12.3568
20.77
29.1832
Jun 3, 2026
ASR (OpenAI Moderation)
ASR (LlamaGuard)
Updated 1mo ago
Evaluation Results
Method
Method
Links
ASR (OpenAI Moderation)
ASR (LlamaGuard)
Trajectory-Level Safety Alignment
Condition=Injection, B...
2026.06
5.19
0
Llama-3.1-8B-Instruct
Condition=No Attack
2026.06
19.04
1.15
Llama-3.1-8B-Instruct
Condition=Injection (n...
2026.06
36.35
19.62
Feedback
Search any
task
Search any
task