Safety Evaluation on Wildguard (test)
0.08Wildguard Test ScoreWHP (W/O safe set)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| WHP (W/O safe set)Backbone=Llama3 8B Instruct2025.04 | 0.08 | — | — | — | |
| DPOBackbone=Llama3 8B Instruct2025.04 | 0.67 | — | — | — | |
| NPOBackbone=Llama3 8B Instruct2025.04 | 0.95 | — | — | — | |
| Safety PromptingBackbone=Llama3 8B Instruct2025.04 | 2.27 | — | — | — | |
| NPOBackbone=Mistral 7B Instruct-v0.22025.04 | 2.8 | — | — | — | |
| CB*Backbone=Llama3 8B Instruct, publicly_available_safety_tuned=true2025.04 | 3.74 | — | — | — | |
| NPO (W/O safe set)Backbone=Llama3 8B Instruct2025.04 | 3.87 | — | — | — | |
| TABackbone=Llama3 8B Instruct2025.04 | 7.08 | — | — | — | |
| REPBENDBackbone=Llama3 8B Instruct2025.04 | 7.34 | — | — | — | |
| RMUBackbone=Mistral 7B Instruct-v0.22025.04 | 7.48 | — | — | — | |
| NPO (W/O safe set)Backbone=Mistral 7B Instruct-v0.22025.04 | 7.61 | — | — | — | |
| WHPBackbone=Llama3 8B Instruct2025.04 | 7.87 | — | — | — | |
| CBBackbone=Llama3 8B Instruct2025.04 | 7.88 | — | — | — | |
| CB*Backbone=Mistral 7B Instruct-v0.2, publicly_available_safety_tuned=true2025.04 | 8.54 | — | — | — | |
| REPBENDBackbone=Mistral 7B Instruct-v0.22025.04 | 8.95 | — | — | — | |
| SFTBackbone=Llama3 8B Instruct2025.04 | 10.15 | — | — | — | |
| RMUBackbone=Llama3 8B Instruct2025.04 | 11.75 | — | — | — | |
| TABackbone=Mistral 7B Instruct-v0.22025.04 | 13.62 | — | — | — | |
| SFTBackbone=Mistral 7B Instruct-v0.22025.04 | 15.49 | — | — | — | |
| OriginalBackbone=Llama3 8B Instruct2025.04 | 15.49 | — | — | — | |
| CBBackbone=Mistral 7B Instruct-v0.22025.04 | 16.29 | — | — | — | |
| DPOBackbone=Mistral 7B Instruct-v0.22025.04 | 36.45 | — | — | — | |
| Safety PromptingBackbone=Mistral 7B Instruct-v0.22025.04 | 38.45 | — | — | — | |
| WHPBackbone=Mistral 7B Instruct-v0.22025.04 | 42.86 | — | — | — | |
| R2D2*Backbone=Mistral 7B Instruct-v0.2, publicly_available_safety_tuned=true2025.04 | 44.46 | — | — | — | |
| WHP (W/O safe set)Backbone=Mistral 7B Instruct-v0.22025.04 | 52.6 | — | — | — | |
| OriginalBackbone=Mistral 7B Instruct-v0.22025.04 | 53 | — | — | — | |
| AdvGameAttacker=Qwen2.5-7B2026.06 | — | — | — | 1.2 | |
| AdvGRPO (ST)Attacker=Qwen2.5-7B2026.06 | — | — | — | 0.5 | |
| AdvGRPO (ST)Attacker=Qwen2.5-14B2026.06 | — | — | — | 0.5 | |
| BaseAttacker=None2026.06 | — | — | — | 23.7 | |
| CoT SFTTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-T2025.10 | — | 82.04 | — | — | |
| CoT SFTTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-M2025.10 | — | 52.95 | — | — | |
| CoT SFTTraining Stage=After MPI Training, Internalized Policy=GTAPolicy2025.10 | — | 69.22 | — | — | |
| CoT SFTTraining Stage=After MPI Training2025.10 | — | — | 68.07 | — | |
| CoT SFT + GRPOTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-T2025.10 | — | 83.21 | — | — | |
| CoT SFT + GRPOTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-M2025.10 | — | 47.69 | — | — | |
| CoT SFT + GRPOTraining Stage=After MPI Training, Internalized Policy=GTAPolicy2025.10 | — | 69.87 | — | — | |
| CoT SFT + GRPOTraining Stage=After MPI Training2025.10 | — | — | 66.92 | — | |
| IQuest-Coder-V1-40B-InstructParameters=40B, Type=Instruct2026.03 | — | 78.1 | — | — | |
| IQuest-Coder-V1-40B-ThinkingParameters=40B, Type=Thinking2026.03 | — | 86.8 | — | — | |
| Qwen2.5-Coder-32B-InstructParameters=32B, Type=Instruct2026.03 | — | 73.9 | — | — | |
| Qwen2.5-VL-7BTraining Stage=Before MPI Training, Internalized Policy=ClevrPolicy-T2025.10 | — | 87.24 | — | — | |
| Qwen2.5-VL-7BTraining Stage=Before MPI Training, Internalized Policy=ClevrPolicy-M2025.10 | — | 87.24 | — | — | |
| Qwen2.5-VL-7BTraining Stage=Before MPI Training, Internalized Policy=GTAPolicy2025.10 | — | 87.24 | — | — | |
| Qwen2.5-VL-7BTraining Stage=Before MPI Training2025.10 | — | — | 87.24 | — | |
| Qwen3-Coder-480B-A35B-InstructParameters=480B-A35B, Type=Instruct2026.03 | — | 85 | — | — | |
| Self-RedTeamAttacker=Qwen2.5-7B2026.06 | — | — | — | 22 | |
| TriMPI w/ PoRo-GRPOTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-T2025.10 | — | 74.9 | — | — | |
| TriMPI w/ PoRo-GRPOTraining Stage=After MPI Training, Internalized Policy=ClevrPolicy-M2025.10 | — | 76.71 | — | — | |
| TriMPI w/ PoRo-GRPOTraining Stage=After MPI Training, Internalized Policy=GTAPolicy2025.10 | — | 76.77 | — | — | |
| TriMPI w/ PoRo-GRPOTraining Stage=After MPI Training2025.10 | — | — | 76.13 | — |