Safety Classification on AEGIS 2
86.2F1 ScoreYuFeng-XGuard-Reason-0.6B
Evaluation Results
| Method | Links | |
|---|---|---|
| YuFeng-XGuard-Reason-0.6BParams=0.6B2026.07 | 86.2 | |
| Qwen3Guard-8B-GenParams=8B2026.07 | 86.1 | |
| Nemotron Safety 4BOptimization Strategy=Dedicated Safety Guard2026.06 | 86 | |
| Qwen3Guard-4B-GenParams=4B2026.07 | 85.8 | |
| YuFeng-XGuard-Reason-8BParams=8B2026.07 | 85.4 | |
| Qwen3Guard-0.8B-GenParams=0.8B2026.07 | 85.1 | |
| Stage1-SFT-v4Params=4B2026.07 | 85.1 | |
| Stage3-DPOParams=4B2026.07 | 84.7 | |
| Stage1-SFT-v1Params=4B2026.07 | 84.4 | |
| Stage2-SFTParams=4B2026.07 | 84.3 | |
| Stage1-SFT-v3Params=4B2026.07 | 83.7 | |
| Stage1-SFT-v2Params=4B2026.07 | 83.6 | |
| Label rewardOptimization Strategy=GRPO2026.06 | 83.3 | |
| GuardReasoner 8BOptimization Strategy=Dedicated Safety Guard2026.06 | 83 | |
| Stage1-SFT-v0Params=4B2026.07 | 83 | |
| LE-DPOOptimization Strategy=DPO2026.06 | 82.4 | |
| Gemma-3-12BOptimization Strategy=Zero-shot2026.06 | 82 | |
| IF-DPOOptimization Strategy=DPO2026.06 | 81.4 | |
| Gemma-3-12BOptimization Strategy=SFT, Supervision Source=Annotated Intents2026.06 | 81.1 | |
| GPT-5.4Optimization Strategy=Zero-shot2026.06 | 80.9 | |
| WildGuard 7BOptimization Strategy=Dedicated Safety Guard2026.06 | 80.9 | |
| Label and intent rewardOptimization Strategy=GRPO2026.06 | 80.8 | |
| GPT-OSS-120BOptimization Strategy=Zero-shot2026.06 | 80.6 | |
| Human-intent on AIMSOptimization Strategy=Reasoning Distillation, Teacher Model=GPT-OSS-120B, Student Model=Gemma-3-12B2026.06 | 80.5 | |
| Llama-3.1-8BOptimization Strategy=SFT, Supervision Source=Annotated Intents2026.06 | 80.3 | |
| Llama-3.1-8BOptimization Strategy=Zero-shot2026.06 | 80 | |
| GPT-OSS-Safeguard 120BOptimization Strategy=Dedicated Safety Guard2026.06 | 79.7 | |
| Claude Sonnet 4.6Optimization Strategy=Zero-shot2026.06 | 76.2 | |
| LlamaGuard 4Optimization Strategy=Dedicated Safety Guard2026.06 | 70.5 | |
| ShieldGemma 27BOptimization Strategy=Dedicated Safety Guard2026.06 | 69.4 |