Safety Evaluation on WildJailbreak
0.0145ASRST-D
Evaluation Results
| Method | Links | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| ST-DBackbone Model=DeepSeek-R1-Distill-Llama-70B2026.06 | 0.0145 | — | — | — | — | — | — | — | — | |
| SInternalModel Architecture=DeepSeek-R1-Distill-Qwen-14B2026.05 | 0.068 | — | — | — | — | — | — | — | — | |
| ST-SBackbone Model=DeepSeek-R1-Distill-Llama-70B2026.06 | 0.0995 | — | — | — | — | — | — | — | — | |
| SETModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.101 | — | — | — | — | — | — | — | — | |
| RECAP2025.10 | 0.113 | — | — | — | — | — | — | — | — | |
| Llama-3-8B-InstructBase Model=Llama-3-8B-Instruct, Inference Method=Direct Inference2025.12 | 0.1315 | — | 0.8579 | — | 0.8476 | 0.8255 | — | — | — | |
| SInternalModel Architecture=DeepSeek-R1-Distill-Llama-8B2026.05 | 0.136 | — | — | — | — | — | — | — | — | |
| SETModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.143 | — | — | — | — | — | — | — | — | |
| SETModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.147 | — | — | — | — | — | — | — | — | |
| SafePathBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.06 | 0.1665 | — | — | — | — | — | — | — | — | |
| Qwen-1.5B-Instruct + CONTEXTLENSBase Model=Qwen2.5-1.5B-Instruct, Inference Method=CONTEXTLENS (3B)2025.12 | 0.1755 | — | 0.6512 | — | 0.5381 | 0.8819 | — | — | — | |
| ST-DBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.06 | 0.1775 | — | — | — | — | — | — | — | — | |
| Llama-3-8B-Instruct + CONTEXTLENSBase Model=Llama-3-8B-Instruct, Inference Method=CONTEXTLENS (3B)2025.12 | 0.178 | — | 0.8592 | — | 0.9 | 0.931 | — | — | — | |
| STAR-1Model Architecture=DeepSeek-R1-Distill-Llama-8B2026.05 | 0.184 | — | — | — | — | — | — | — | — | |
| STAR-1Model Architecture=DeepSeek-R1-Distill-Qwen-14B2026.05 | 0.184 | — | — | — | — | — | — | — | — | |
| PreSafebase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.188 | — | — | — | — | — | — | — | — | |
| SETModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.191 | — | — | — | — | — | — | — | — | |
| SETModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.201 | — | — | — | — | — | — | — | — | |
| STAR2025.10 | 0.214 | — | — | — | — | — | — | — | — | |
| SInternalModel Architecture=DeepSeek-R1-Distill-Qwen-7B2026.05 | 0.216 | — | — | — | — | — | — | — | — | |
| ST-DBackbone Model=Qwen3-8B2026.06 | 0.232 | — | — | — | — | — | — | — | — | |
| SAFE-LLAMA-8BBase Model=Llama-3-8B2025.10 | 0.246 | — | — | — | — | — | — | — | — | |
| SafePathBackbone Model=Qwen3-32B2026.06 | 0.248 | — | — | — | — | — | — | — | — | |
| TARS-1.5BBase Model=TARS-1.5B, Inference Method=Reasoning Model2025.12 | 0.254 | — | 0.8079 | — | 0.881 | 0.906 | — | — | — | |
| TARS-7BBase Model=TARS-7B, Inference Method=Reasoning Model2025.12 | 0.2645 | — | 0.8171 | — | 0.919 | 0.8881 | — | — | — | |
| SETModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.265 | — | — | — | — | — | — | — | — | |
| DAPO2025.10 | 0.271 | — | — | — | — | — | — | — | — | |
| ST-DBackbone Model=Qwen3-32B2026.06 | 0.271 | — | — | — | — | — | — | — | — | |
| ST-SBackbone Model=Qwen3-32B2026.06 | 0.2715 | — | — | — | — | — | — | — | — | |
| SafePathBackbone Model=DeepSeek-R1-Distill-Llama-70B2026.06 | 0.2895 | — | — | — | — | — | — | — | — | |
| ST-SBackbone Model=Qwen3-8B2026.06 | 0.295 | — | — | — | — | — | — | — | — | |
| Star1Backbone Model=DeepSeek-R1-Distill-Llama-70B2026.06 | 0.296 | — | — | — | — | — | — | — | — | |
| ST-SBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.06 | 0.2995 | — | — | — | — | — | — | — | — | |
| STAR-1Model Architecture=DeepSeek-R1-Distill-Qwen-7B2026.05 | 0.3 | — | — | — | — | — | — | — | — | |
| Star1Backbone Model=Qwen3-32B2026.06 | 0.3085 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.309 | — | — | — | — | — | — | — | — | |
| BaseBackbone Model=DeepSeek-R1-Distill-Llama-70B2026.06 | 0.3245 | — | — | — | — | — | — | — | — | |
| Qwen-1.5B-InstructBase Model=Qwen2.5-1.5B-Instruct, Inference Method=Direct Inference2025.12 | 0.325 | — | 0.7607 | — | 0.8714 | 0.8976 | — | — | — | |
| SafePathbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.328 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.338 | — | — | — | — | — | — | — | — | |
| GPT-4o + CONTEXTLENSBase Model=GPT-4o, Inference Method=CONTEXTLENS (3B)2025.12 | 0.3435 | — | 0.7804 | — | 0.9619 | 0.9162 | — | — | — | |
| Qwen-3B-Instruct + CONTEXTLENSBase Model=Qwen2.5-3B-Instruct, Inference Method=CONTEXTLENS (3B)2025.12 | 0.35 | — | 0.7631 | — | 0.9238 | 0.9111 | — | — | — | |
| BaseBackbone Model=Qwen3-32B2026.06 | 0.354 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.369 | — | — | — | — | — | — | — | — | |
| SafePathBackbone Model=Qwen3-8B2026.06 | 0.3695 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.374 | — | — | — | — | — | — | — | — | |
| Star1Backbone Model=Qwen3-8B2026.06 | 0.374 | — | — | — | — | — | — | — | — | |
| LoRAModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.386 | — | — | — | — | — | — | — | — | |
| SafeChain-8BBase Model=SafeChain-8B, Inference Method=Reasoning Model2025.12 | 0.3915 | — | 0.744 | — | 0.9571 | 0.8929 | — | — | — | |
| Star1Backbone Model=DeepSeek-R1-Distill-Llama-8B2026.06 | 0.3915 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.399 | — | — | — | — | — | — | — | — | |
| LoRAModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.416 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.426 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.427 | — | — | — | — | — | — | — | — | |
| SafeChainModel Architecture=DeepSeek-R1-Distill-Llama-8B2026.05 | 0.428 | — | — | — | — | — | — | — | — | |
| BaseBackbone Model=Qwen3-8B2026.06 | 0.428 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.431 | — | — | — | — | — | — | — | — | |
| LoRAModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.438 | — | — | — | — | — | — | — | — | |
| SafeChainModel Architecture=DeepSeek-R1-Distill-Qwen-7B2026.05 | 0.44 | — | — | — | — | — | — | — | — | |
| BaseModel Architecture=DeepSeek-R1-Distill-Qwen-14B2026.05 | 0.444 | — | — | — | — | — | — | — | — | |
| SafeChainModel Architecture=DeepSeek-R1-Distill-Qwen-14B2026.05 | 0.452 | — | — | — | — | — | — | — | — | |
| SafeLoRAModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.465 | — | — | — | — | — | — | — | — | |
| SafeChain2025.10 | 0.47 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.475 | — | — | — | — | — | — | — | — | |
| SafeChainbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.48 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.48 | — | — | — | — | — | — | — | — | |
| BaseModel Architecture=DeepSeek-R1-Distill-Llama-8B2026.05 | 0.484 | — | — | — | — | — | — | — | — | |
| LoRAModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.495 | — | — | — | — | — | — | — | — | |
| LoRAModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.496 | — | — | — | — | — | — | — | — | |
| BaseBackbone Model=DeepSeek-R1-Distill-Llama-8B2026.06 | 0.499 | — | — | — | — | — | — | — | — | |
| SN-tuneModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.509 | — | — | — | — | — | — | — | — | |
| LoRAModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.521 | — | — | — | — | — | — | — | — | |
| GPT-4oBase Model=GPT-4o, Inference Method=Direct Inference2025.12 | 0.5265 | — | 0.6407 | — | 0.9905 | 0.8741 | — | — | — | |
| RandomModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.551 | — | — | — | — | — | — | — | — | |
| RandomModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.556 | — | — | — | — | — | — | — | — | |
| BaseModel Architecture=DeepSeek-R1-Distill-Qwen-7B2026.05 | 0.56 | — | — | — | — | — | — | — | — | |
| Qwen-3B-InstructBase Model=Qwen2.5-3B-Instruct, Inference Method=Direct Inference2025.12 | 0.5735 | — | 0.5971 | — | 0.9952 | 0.861 | — | — | — | |
| RandomModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.591 | — | — | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.598 | — | — | — | — | — | — | — | — | |
| UnSafeChainbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.62 | — | — | — | — | — | — | — | — | |
| BaseModel=Llama3-8B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.625 | — | — | — | — | — | — | — | — | |
| BaseModel=Llama3-8B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.625 | — | — | — | — | — | — | — | — | |
| DS-7Bbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.644 | — | — | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.648 | — | — | — | — | — | — | — | — | |
| R2Dbase_model=DeepSeek-R1-Distill-Qwen-7B2026.03 | 0.65 | — | — | — | — | — | — | — | — | |
| RandomModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.669 | — | — | — | — | — | — | — | — | |
| BaseModel=Qwen2.5-14B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.676 | — | — | — | — | — | — | — | — | |
| BaseModel=Qwen2.5-14B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.676 | — | — | — | — | — | — | — | — | |
| BaseModel=Qwen2.5-7B-base, Fine-tuning Dataset=R1-Safety2026.04 | 0.772 | — | — | — | — | — | — | — | — | |
| BaseModel=Qwen2.5-7B-base, Fine-tuning Dataset=CB-Safety2026.04 | 0.772 | — | — | — | — | — | — | — | — | |
| BaseModel=Llama3-8B-it, Fine-tuning Task=AGNews2026.04 | — | — | — | — | — | — | 30.5 | — | — | |
| BaseModel=Llama3-8B-it, Fine-tuning Task=MedicalQA2026.04 | — | — | — | — | — | — | 30.5 | — | — | |
| BaseModel=Llama3-8B-it, Fine-tuning Task=GSM8K2026.04 | — | — | — | — | — | — | 30.5 | — | — | |
| BaseModel=Qwen2.5-7B-it, Fine-tuning Task=AGNews2026.04 | — | — | — | — | — | — | 58 | — | — | |
| BaseModel=Qwen2.5-7B-it, Fine-tuning Task=MedicalQA2026.04 | — | — | — | — | — | — | 58 | — | — | |
| BaseModel=Qwen2.5-7B-it, Fine-tuning Task=GSM8K2026.04 | — | — | — | — | — | — | 58 | — | — | |
| BaseModel=Qwen2.5-14B-it, Fine-tuning Task=AGNews2026.04 | — | — | — | — | — | — | 36 | — | — | |
| BaseModel=Qwen2.5-14B-it, Fine-tuning Task=MedicalQA2026.04 | — | — | — | — | — | — | 36 | — | — | |
| BaseModel=Qwen2.5-14B-it, Fine-tuning Task=GSM8K2026.04 | — | — | — | — | — | — | 36 | — | — | |
| BaseModel Backbone=DeepSeek-R1-Distill-Qwen-7B, RL Training (GRPO)=true2026.05 | — | — | — | — | — | — | — | — | 12.4 |