| Dataset Name | SOTA Method | Metric | Trend | ||
|---|---|---|---|---|---|
| DirectHarm | Harmfulness Score5 | 56 | 3mo ago | ||
| DirectHarm (test) | Harmfulness Score (Llama-Guard-3B)5 | 56 | 3mo ago | ||
| Harmfulness Evaluation Suite JBB, SR, WJ, GCG, JBC, PAIR (test) | No train | JBB91 | 36 | 3mo ago | |
| AdvBench | Harmfulness Score1.04 | 28 | 1mo ago | ||
| HarmBench | Harmful Response Ratio1.12 | 27 | 1mo ago | ||
| Mousetrap | Harmfulness Score3.78 | 22 | 2mo ago | ||
| AutoRAN | SAFEPATH-FT | Harmfulness Score1.32 | 22 | 2mo ago | |
| PAIR | SAFEPATH-FT | Harmfulness Score1.08 | 22 | 2mo ago | |
| GCG | SAFEPATH-FT | Harmfulness Score1.16 | 22 | 2mo ago | |
| AdvBench-audio Harmful | MDSteer-h2s | ASR Score26.35 | 15 | 2mo ago | |
| SORRY-Bench audio | MDSteer-c2r | ASR Accuracy78.41 | 15 | 2mo ago | |
| Figstep-audio Harmful | MDSteer-c2r | ASR90.8 | 15 | 2mo ago | |
| AJailBench Harmful | MDSteer-c2r | ASR49 | 12 | 2mo ago | |
| HH Harmless | DLMA | Beaver-7B Cost Score3.25 | 10 | 4mo ago | |
| PKU-SafeRLHF | DLMA | Beaver-7B-Cost Score-1.11 | 10 | 4mo ago | |
| HEx-PHI, AdvBench, HarmBench, & JailbreakBench Full | RLVR | Average Score (Full)4.95 | 6 | 1mo ago | |
| HEx-PHI & AdvBench Primary | Primary Average1.15 | 6 | 1mo ago | ||
| JailbreakBench | Harmfulness Score1.13 | 6 | 1mo ago | ||
| HEx-PHI | Harmfulness Score1.26 | 6 | 1mo ago | ||
| HarmfulQ | NLCf/800 step | Harmfulness Rate0 | 6 | 1mo ago | |
| I-Controversial | Mistral MoE-XL | Rate0 | 6 | 1mo ago | |
| I-CoNa | NLCf/800 step | Harmfulness Rate0 | 6 | 1mo ago | |
| I-Malicious | NLCf/800 step | Harmful Rate0 | 6 | 1mo ago | |
| AgentHarm | ReAct | HS Score62.42 | 3 | 1mo ago | |
| HarmMetric Eval | HarmClassifier | Score (Effectiveness)89.6 | 2 | 4mo ago |