Policy Violation Detection on DynaBench (test)
86F1 ScoreActivation-Space Whitening
Evaluation Results
| Method | Links | |
|---|---|---|
| Activation-Space WhiteningBase Model=Qwen2.5-7B-Instruct, Approach=Whitening2025.12 | 86 | |
| Activation-Space WhiteningBase Model=Qwen3-8B, Approach=Whitening2025.12 | 78.4 | |
| Activation-Space WhiteningBase Model=Llama-3.1-8b-instruct, Approach=Whitening2025.12 | 75.6 | |
| Activation-Space WhiteningBase Model=Gemma-2-9B-it, Approach=Whitening2025.12 | 75.2 | |
| DynaGuard-8BApproach=Fine-tuned2025.12 | 73.1 | |
| DynaGuard-8B (non-CoT)Approach=Fine-tuned2025.12 | 72.5 | |
| DynaGuard-4BApproach=Fine-tuned2025.12 | 72 | |
| GPT-4o-miniApproach=LLM-as-a-judge2025.12 | 70.1 | |
| Activation-Space WhiteningBase Model=Mistral-7B-Instruct-v0.2, Approach=Whitening2025.12 | 66.8 | |
| DynaGuard-1.7BApproach=Fine-tuned2025.12 | 65.2 | |
| Qwen3-8BApproach=LLM-as-a-judge2025.12 | 60.7 | |
| LlamaGuard-3Approach=Fine-tuned2025.12 | 20.9 |