Safety Classification Disagreement on WildChat Content
0.4Disagreement Rate (per 1k Conversations)Gemini 3.1
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3.1Category=Non-Violent Crime, Evaluation Protocol=Constitution2026.05 | 0.4 | |
| GPT-5.4 MiniCategory=Non-Violent Crime, Evaluation Protocol=Constitution2026.05 | 0.7 | |
| Gemini 3.1Category=Harassment, Evaluation Protocol=Constitution2026.05 | 1 | |
| GPT-5.4 MiniCategory=Harassment, Evaluation Protocol=Constitution2026.05 | 1.1 | |
| GPT-5.4Category=Harassment, Evaluation Protocol=Constitution2026.05 | 1.5 | |
| GPT-5.4Category=Non-Violent Crime, Evaluation Protocol=Constitution2026.05 | 1.5 | |
| Gemini 3.1Category=Hate Speech, Evaluation Protocol=Constitution2026.05 | 1.7 | |
| GPT-5.4Category=Hate Speech, Evaluation Protocol=Constitution2026.05 | 1.9 | |
| Safeguard 20BCategory=Harassment, Evaluation Protocol=Constitution2026.05 | 1.9 | |
| GPT-5.4 MiniCategory=Hate Speech, Evaluation Protocol=Constitution2026.05 | 2.2 | |
| Safeguard 20BCategory=Hate Speech, Evaluation Protocol=Constitution2026.05 | 2.4 | |
| Gemini 3.1Category=Hate Speech, Evaluation Protocol=Definition2026.05 | 2.5 | |
| Safeguard 20BCategory=Non-Violent Crime, Evaluation Protocol=Constitution2026.05 | 2.9 | |
| GPT-5.4 MiniCategory=Hate Speech, Evaluation Protocol=Definition2026.05 | 4.1 | |
| Safeguard 20BCategory=Hate Speech, Evaluation Protocol=Definition2026.05 | 4.1 | |
| GPT-5.4 NanoCategory=Hate Speech, Evaluation Protocol=Constitution2026.05 | 4.6 | |
| Gemini 3.1Category=Non-Violent Crime, Evaluation Protocol=Definition2026.05 | 4.8 | |
| Gemini 3.1Category=Harassment, Evaluation Protocol=Definition2026.05 | 5.1 | |
| GPT-5.4 NanoCategory=Non-Violent Crime, Evaluation Protocol=Constitution2026.05 | 5.1 | |
| GPT-5.4 MiniCategory=Non-Violent Crime, Evaluation Protocol=Definition2026.05 | 6.8 | |
| GPT-5.4 NanoCategory=Harassment, Evaluation Protocol=Constitution2026.05 | 6.8 | |
| GPT-5.4Category=Non-Violent Crime, Evaluation Protocol=Definition2026.05 | 8.1 | |
| GPT-5.4 NanoCategory=Hate Speech, Evaluation Protocol=Definition2026.05 | 8.1 | |
| Safeguard 20BCategory=Non-Violent Crime, Evaluation Protocol=Definition2026.05 | 9.7 | |
| GPT-5.4Category=Hate Speech, Evaluation Protocol=Definition2026.05 | 12.1 | |
| GPT-5.4 NanoCategory=Non-Violent Crime, Evaluation Protocol=Definition2026.05 | 20.5 | |
| Safeguard 20BCategory=Harassment, Evaluation Protocol=Definition2026.05 | 29.3 | |
| GPT-5.4 MiniCategory=Harassment, Evaluation Protocol=Definition2026.05 | 42.2 | |
| GPT-5.4Category=Harassment, Evaluation Protocol=Definition2026.05 | 47.2 | |
| GPT-5.4 NanoCategory=Harassment, Evaluation Protocol=Definition2026.05 | 66.2 |