Share your thoughts, 1 month free Claude Pro on us
See more
Home
/
Benchmarks
Safety Classification on OpenAI Moderation
Loading...
81.4
F1 Score
ShieldGemma 27B
69.96
72.93
75.9
78.87
Jun 25, 2026
F1 Score
Updated 29d ago
Evaluation Results
Method
Method
Links
F1 Score
ShieldGemma 27B
Optimization Strategy=...
2026.06
81.4
Label and intent reward
Optimization Strategy=...
2026.06
80.9
Label reward
Optimization Strategy=...
2026.06
79.8
Gemma-3-12B
Optimization Strategy=...
2026.06
79.3
Human-intent on AIMS
Optimization Strategy=...
2026.06
79.2
GPT-5.4
Optimization Strategy=...
2026.06
79.1
Claude Sonnet 4.6
Optimization Strategy=...
2026.06
78.5
GPT-OSS-Safeguard 120B
Optimization Strategy=...
2026.06
78
GPT-OSS-120B
Optimization Strategy=...
2026.06
77.5
IF-DPO
Optimization Strategy=DPO
2026.06
76.6
LE-DPO
Optimization Strategy=DPO
2026.06
76.5
Llama-3.1-8B
Optimization Strategy=...
2026.06
76.1
Gemma-3-12B
Optimization Strategy=...
2026.06
76.1
Nemotron Safety 4B
Optimization Strategy=...
2026.06
74.7
LlamaGuard 4
Optimization Strategy=...
2026.06
73.6
Llama-3.1-8B
Optimization Strategy=...
2026.06
72.8
WildGuard 7B
Optimization Strategy=...
2026.06
72.4
GuardReasoner 8B
Optimization Strategy=...
2026.06
70.4
Feedback
Search any
task
Search any
task