Response Safety Evaluation on GRANDGUARD unsafe prompts
89.8Safe Rateclaude-sonnet-4.5
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| claude-sonnet-4.5decoding=default2026.04 | 89.8 | 10.2 | 7.2 | 3 | |
| claude-sonnet-3.7decoding=default2026.04 | 87.4 | 13.6 | 8.2 | 5.4 | |
| gpt-5.1decoding=default2026.04 | 56.2 | 43.8 | 30.2 | 13.6 | |
| gemini-2.5-flashdecoding=default2026.04 | 45 | 55 | 39.6 | 15.4 | |
| qwen3-maxdecoding=default2026.04 | 43.8 | 56.2 | 41.2 | 15 | |
| deepseek-v3.2decoding=default2026.04 | 39.6 | 60.4 | 43.2 | 17.2 | |
| grok-4.1decoding=default2026.04 | 39.2 | 60.8 | 41.8 | 19 | |
| gpt-oss-120bdecoding=default2026.04 | 28.6 | 71.4 | 57.8 | 13.6 | |
| llama-4-maverickdecoding=default2026.04 | 28.2 | 71.8 | 54 | 17.8 | |
| gpt-4.1-minidecoding=default2026.04 | 22.6 | 77.4 | 49.2 | 28.2 |