Policy Evaluation on PolicyBench Level 2 (US)
68.95AccuracyClaude 3.5
Evaluation Results
| Method | Links | |
|---|---|---|
| Claude 3.5Model Variant=Claude-3.5-Sonnet2026.04 | 68.95 | |
| Claude 3.7Model Variant=Claude-3.7-Sonnet2026.04 | 68.23 | |
| Deepseek R12026.04 | 65.37 | |
| Gemini 2.5Model Variant=Gemini-2.5-Flash2026.04 | 64.91 | |
| o4-mini2026.04 | 64.71 | |
| GPT-4o2026.04 | 63.4 | |
| Gemini 2.0Model Variant=Gemini-2.0-Flash2026.04 | 62.25 | |
| Gemma 3-27B2026.04 | 62.17 | |
| LLaMA 42026.04 | 61.17 | |
| Deepseek V32026.04 | 58.62 | |
| QwQ 32B2026.04 | 57.71 |