Multiple-Choice Questioning on SafetyBench English (test)
60.13AccuracySafety Game (SG)
Evaluation Results
| Method | Links | |
|---|---|---|
| Safety Game (SG)Base Model=GPT-OSS-20B2025.10 | 60.13 | |
| DBase Model=GPT-OSS-20B2025.10 | 57.4 | |
| Safety Game (SG)Base Model=Llama-3.1-8B2025.10 | 56.09 | |
| Safety Game (SG)Base Model=LLaMA-2-7B2025.10 | 54.79 | |
| Safety Game (SG)Base Model=LLaMA-2-13B2025.10 | 54.39 | |
| MIBase Model=Llama-3.1-8B2025.10 | 52.47 | |
| GBase Model=Llama-3.1-8B2025.10 | 52.46 | |
| MIBase Model=LLaMA-2-13B2025.10 | 49.41 | |
| GBase Model=LLaMA-2-13B2025.10 | 49.11 | |
| SCBase Model=LLaMA-2-13B2025.10 | 46.12 | |
| GBase Model=LLaMA-2-7B2025.10 | 45.71 | |
| MIBase Model=LLaMA-2-7B2025.10 | 45.61 | |
| SCBase Model=Llama-3.1-8B2025.10 | 45.61 | |
| MIBase Model=Llama-3.2-1B2025.10 | 44.61 | |
| GBase Model=Llama-3.2-1B2025.10 | 44.5 | |
| SCBase Model=LLaMA-2-7B2025.10 | 44.46 | |
| DBase Model=Llama-3.1-8B2025.10 | 43.89 | |
| ER-DBase Model=GPT-OSS-20B2025.10 | 42.65 | |
| MIBase Model=GPT-OSS-20B2025.10 | 42.59 | |
| GBase Model=GPT-OSS-20B2025.10 | 42.35 | |
| ER-GBase Model=GPT-OSS-20B2025.10 | 41.67 | |
| ER-GBase Model=Llama-3.1-8B2025.10 | 41.49 | |
| ER-DBase Model=Llama-3.1-8B2025.10 | 41.49 | |
| ER-GBase Model=LLaMA-2-13B2025.10 | 41.43 | |
| ER-DBase Model=LLaMA-2-13B2025.10 | 41.42 | |
| ER-DBase Model=LLaMA-2-7B2025.10 | 39.96 | |
| ER-GBase Model=LLaMA-2-7B2025.10 | 39.94 | |
| DBase Model=LLaMA-2-7B2025.10 | 39.4 | |
| DBase Model=LLaMA-2-13B2025.10 | 39.29 | |
| SCBase Model=Llama-3.2-1B2025.10 | 39.14 | |
| Safety Game (SG)Base Model=Llama-3.2-1B2025.10 | 39 | |
| SCBase Model=GPT-OSS-20B2025.10 | 38.66 | |
| ER-DBase Model=Llama-3.2-1B2025.10 | 38.19 | |
| ER-GBase Model=Llama-3.2-1B2025.10 | 38.15 | |
| DBase Model=Llama-3.2-1B2025.10 | 35.31 |