Harmful Content Detection on WG, XS, AEGIS 2, ToxicChat, OAI Mod (test)
83.6F1 ScoreLlama-3.1-8B GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-3.1-8B GRPOLatency (ms)=25.28, Generated Tokens=193.52026.06 | 83.6 | |
| Gemma-3-12B DistillLatency (ms)=33.01, Generated Tokens=145.22026.06 | 82.2 | |
| Llama-3.1-8B DistillLatency (ms)=20.19, Generated Tokens=144.32026.06 | 82 | |
| Llama-3.1-8B LE-DPOLatency (ms)=5.52, Generated Tokens=25.82026.06 | 81.2 | |
| Nemotron Safety 4BLatency (ms)=8.20, Generated Tokens=70.12026.06 | 80.9 | |
| Gemma-3-12B SFTLatency (ms)=12.71, Generated Tokens=24.02026.06 | 80.8 | |
| GPT OSS Safeguard 120BLatency (ms)=24.66, Generated Tokens=136.92026.06 | 80.7 | |
| WildGuard 7BLatency (ms)=6.46, Generated Tokens=23.02026.06 | 80.4 | |
| GuardReasoner 8BLatency (ms)=31.63, Generated Tokens=285.92026.06 | 80.4 | |
| Llama-3.1-8B SFTLatency (ms)=4.66, Generated Tokens=17.92026.06 | 79.1 | |
| ShieldGemma 27BLatency (ms)=53.19, Generated Tokens=1.02026.06 | 70.9 | |
| LlamaGuard 4 12BLatency (ms)=7.44, Generated Tokens=3.72026.06 | 69.1 |