Prompt-level Risk Detection on GRANDGUARD
53.9F1 Scoregpt-oss-safeguard-20b
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| gpt-oss-safeguard-20b2026.04 | 53.9 | 67.6 | 93.1 | 38 | |
| llama-guard-32026.04 | 49.2 | 63.3 | 79.7 | 35.6 | |
| llama-guard-42026.04 | 48.9 | 63 | 79.2 | 35.3 | |
| llama-guard-22026.04 | 41.5 | 59.6 | 74.9 | 28.7 | |
| omni-moderation2026.04 | 10.8 | 52.8 | 98.9 | 5.7 |