Safety Classification on GuardSet (test)
96.26Accuracy (Harmless)GPT-4o-mini
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GPT-4o-miniEvaluation Paradigm=Guardian-as-an-Advisor (GaaA), Labeling Scheme=Fine-grained2026.04 | 96.26 | 80.06 | 88.16 | |
| GPT-4oEvaluation Paradigm=Guardian-as-an-Advisor (GaaA), Labeling Scheme=Fine-grained2026.04 | 95.41 | 87.39 | 91.4 | |
| GuardAdvisorEvaluation Paradigm=Guardian-as-an-Advisor (GaaA), Labeling Scheme=Fine-grained2026.04 | 95.08 | 85.95 | 90.52 | |
| Granite-GuardianEvaluation Paradigm=Binary Classification, Labeling Scheme=Binary2026.04 | 92.07 | 89.06 | 90.57 | |
| WildGuardEvaluation Paradigm=Binary Classification, Labeling Scheme=Binary2026.04 | 91.67 | 89.06 | 90.37 | |
| Llama-Guard-4Evaluation Paradigm=Binary Classification, Labeling Scheme=Binary2026.04 | 64.35 | 94.21 | 79.28 | |
| Llama-Guard-3Evaluation Paradigm=Binary Classification, Labeling Scheme=Binary2026.04 | 57.08 | 96.09 | 76.59 |