| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| Safety evaluation | Sorry-Bench | Safety Score99.09 | 90 | |
| Alignment Faking Rate Measurement | SORRY-BENCH | Alignment Faking Rate0.9 | 46 | |
| Safety Alignment | SORRY-Bench | ASR10.22 | 40 | |
| Safety Evaluation | SORRY-Bench | Expected HFR0.9 | 35 | |
| Safety Evaluation | Sorry-Bench base | Safety Score92.73 | 27 | |
| Harmful Request Defense | SORRY-Bench | ASR13 | 24 | |
| Harmfulness Evaluation | SORRY-Bench audio | ASR Accuracy78.41 | 15 | |
| Safety alignment | SORRY-Bench | Score85.7 | 14 | |
| Safety Evaluation | SORRY-Bench | Compliance Rate26.9 | 12 | |
| Refusal Control | SORRY-Bench | Refusal Rate70.45 | 7 | |
| Safety Classification | Sorry-Bench (test) | Accepted HF Accuracy93.9 | 6 | |
| Harmful Refusal | Sorry-Bench | Refusal Rate (String Match)85.5 | 6 | |
| Safety Evaluation | Sorry-Bench | Ref %65.7 | 6 | |
| Harmful-request assistance | SORRY-Bench linguistic mutations | Compliance Rate25.4 | 6 | |
| Harmful-request assistance | SORRY-Bench decontaminated base prompts | Compliance Rate17.1 | 6 |