Unsafe Prompt Detection on XSTest
93.6AUPRCGradSafe-Zero
Evaluation Results
| Method | Links | |
|---|---|---|
| GradSafe-ZeroBackbone=Llama-2-7b-chat-hf2024.02 | 93.6 | |
| Llama GuardBackbone=Llama-2 7b2024.02 | 88.9 | |
| OpenAI Moderation API2024.02 | 77.9 | |
| Perspective API2024.02 | 71.3 |
| Method | Links | |
|---|---|---|
| GradSafe-ZeroBackbone=Llama-2-7b-chat-hf2024.02 | 93.6 | |
| Llama GuardBackbone=Llama-2 7b2024.02 | 88.9 | |
| OpenAI Moderation API2024.02 | 77.9 | |
| Perspective API2024.02 | 71.3 |