Policy Evaluation on PolicyBench Level 1 (US)
59.33AccuracyDeepseek R1
Evaluation Results
| Method | Links | |
|---|---|---|
| Deepseek R12026.04 | 59.33 | |
| Claude 3.5Model Variant=Claude-3.5-Sonnet2026.04 | 58.76 | |
| Claude 3.7Model Variant=Claude-3.7-Sonnet2026.04 | 58.68 | |
| Gemini 2.5Model Variant=Gemini-2.5-Flash2026.04 | 57.73 | |
| o4-mini2026.04 | 54.9 | |
| Gemini 2.0Model Variant=Gemini-2.0-Flash2026.04 | 53.71 | |
| GPT-4o2026.04 | 52.69 | |
| LLaMA 42026.04 | 52.55 | |
| Deepseek V32026.04 | 50.12 | |
| Gemma 3-27B2026.04 | 49.91 | |
| QwQ 32B2026.04 | 46.4 |