Share your thoughts, 1 month free Claude Pro on usSee more
WorkDL logo mark

WildGuard

Benchmarks

Task NameDataset NameSOTA ResultTrend
Harmfulness DetectionWildGuard
Macro F1 Score90.6
47
Safety classificationWildGuard (test)
F1 Score88.8
35
Response Harmfulness ClassificationWildGuard (test)
F1 (Total)79.48
30
Safety EvaluationWildguard (test)
Wildguard Test Score0.08
27
Text-based safety moderationWildGuard
F1 Score80.26
26
Value AlignmentWildGuard (test)
Score29.69
24
Input ModerationWildGuard (test)
F1 Score89.5
22
Prompt Harmfulness ClassificationWILDGUARD (test)
F1 Score89.44
18
Safety EvaluationWildGuard
WildGuard Refusal Rate25.5
16
Prompt ClassificationWildGuard Text Prompt
F1 Score90.46
14
Refusal DetectionWILDGUARD (test)
F1 (Harmful)94
14
Binary safety classificationwildguard prompt safety
Macro F197.91
11
Output ModerationWildGuard (test)
F1 Score79.5
11
False Positive Rate Detection on Benign PromptsWildGuard benign
FPR3.44
10
Stealthiness EvaluationWildGuard 7B
Mean Perplexity2.33
10
Streaming Safety DetectionWildGuard (test)
Det@183.45
8
Jailbreak AttackWildGuard (test)
ASR82.64
8
Violation DetectionWildGuard (test)
Safety F189.17
7
Refusal EvaluationWildGuard Harmful
Refusal Rate84.35
7
Over-refusal EvaluationWildGuard Unharmful
Over-refusal Rate1.06
7
Safety ModerationWildGuard Prompt
F1 Score89.5
7
Audio Safety ModerationWildGuard-TTS
F1 Score88.4
7
Safety EvaluationWildGuard (Unsafe)
Refusal Rate54.9
6
Safety EvaluationWildGuard (Safe)
Refusal Rate30.7
6
Multi-label Safety Categorizationwildguard prompt subcategory
Macro Accuracy83.35
4
Showing 25 of 28 rows