| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| WildJailbreak | LLaDA-Instruct | Unsafe Rate0 | 165 | 1mo ago | |
| JailbreakBench | LLaDA-Instruct | Harmbench ASR0 | 88 | 23d ago | |
| HarmBench | Dream-Instruct | HarmBench ASR0 | 72 | 2mo ago | |
| AdvBench | LLaDA-Instruct | Harmbench ASR0 | 72 | 2mo ago | |
| StrongREJECT | LLaDA-Instruct | Mean Harmful Score0 | 71 | 2mo ago | |
| STRONGREJECT (train) | IHO | EVUS93 | 62 | 1mo ago | |
| JBB | BCT | ASR2 | 35 | 1mo ago | |
| WJ (heldout) | BCT | Attack Success Rate (ASR)5 | 30 | 1mo ago | |
| StrongReject | Direct Attack Rate67 | 30 | 2mo ago | ||
| JBB-Behaviors (test) | MOSA | ASR0 | 24 | 4mo ago | |
| Fortress | PolicyAlign | ASR7.2 | 21 | 1mo ago | |
| Jailbreak Attacks | Prefill Success Rate88.8 | 18 | 1mo ago | ||
| HarmBench 1.0 (test) | Circuit-Breaker (CB) | GCG Attack Success Rate3.13 | 18 | 2mo ago | |
| JB-R1 | Self-ReSET | Evaluation Score (avg@4)98.1 | 18 | 2mo ago | |
| safe-unlearning | Self-ReSET | Avg Evaluation Score (k=4)98 | 18 | 2mo ago | |
| WildTeaming WJ | Self-ReSET | Evaluation Score (avg@4)95.1 | 18 | 2mo ago | |
| JBB-Behaviors | RA (ours) | ASR (PAIR, Guardrail Model)0.3 | 18 | 4mo ago | |
| Mousetrap | SAFEPATH-ZS | Harmfulness Rate0 | 17 | 2mo ago | |
| AutoRAN | RealSafe-R1 | Harmfulness Rate0 | 17 | 2mo ago | |
| JailbreakBench 100 behaviors, 10 categories | Qwen2.5-Instruct 0.5B | AE (GCG)23.4 | 10 | 1mo ago | |
| HarmBench | Tulu3 SFT | AE (Risk/TFLOPs) GCG0.5 | 10 | 1mo ago | |
| Jailbreak Cipher, CodeChameleon (test) | DASE | Cipher Success Rate95.75 | 10 | 4mo ago | |
| WildJailbreak (eval) | Qwen2.5-7B-Instruct | Compliance Rate78.4 | 9 | 18d ago | |
| PAIR v1 (test) | Qwen2.5-7B-Instruct | Compliance Rate15.6 | 9 | 18d ago | |
| JailbreakV v1 (test) | Qwen2.5-7B-Instruct | Compliance Rate63.8 | 9 | 18d ago |