| Task Name | Dataset Name | SOTA Result | Trend | |
|---|---|---|---|---|
| LLM Steering | Anthropic Model-Written Evaluations (MWE) In-distribution | Steerability2.363 | 8 | |
| Behavioral Steering | Anthropic Model-Written Evaluations Sycophancy (test) | Average Token Probability70 | 7 | |
| Behavioral Steering | Anthropic Model-Written Evaluations Survival Instinct (test) | Average Token Probability93 | 7 | |
| Behavioral Steering | Anthropic Model-Written Evaluations Myopic Reward (test) | Average Token Probability0.99 | 7 | |
| Behavioral Steering | Anthropic Model-Written Evaluations Hallucination (test) | Avg Token Probability39 | 7 | |
| Behavioral Steering | Anthropic Model-Written Evaluations Corrigibility (test) | Average Token Probability94 | 7 | |
| Behavioral Steering | Anthropic Model-Written Evaluations AI Coordination (test) | Average Token Probability34 | 7 |