Multiple Choice Questions on ARC Challenge
99.4AccuracyBERT-Judge
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BERT-Judgeclean_name=BERT-as-a-Judge2026.04 | 99.4 | — | — | |
| PIFModel=Qwen3-32B2026.03 | 96.1 | 97.6 | 96.8 | |
| PA-GRPOModel=Qwen3-32B2026.03 | 96 | 98.3 | 97.2 | |
| PriDeModel=Qwen3-32B2026.03 | 95.5 | 97.4 | 95.8 | |
| GRPOModel=Qwen3-32B2026.03 | 95.3 | 98.1 | 97 | |
| PA-GRPOModel=Qwen3-8B2026.03 | 95 | 97.5 | 96.2 | |
| GRPOModel=Qwen3-8B2026.03 | 94.6 | 97.2 | 95.9 | |
| BaseModel=Qwen3-32B2026.03 | 94.5 | 97.2 | 95.7 | |
| UniBiasModel=Qwen3-32B2026.03 | 94.5 | 95.8 | 95.1 | |
| CalibraEvalModel=Qwen3-32B2026.03 | 93.9 | 96.8 | 96 | |
| PIFModel=Qwen3-8B2026.03 | 92.2 | 95.4 | 93.5 | |
| PriDeModel=Qwen3-8B2026.03 | 91.2 | 94.9 | 92.6 | |
| BaseModel=Qwen3-8B2026.03 | 90.5 | 94.7 | 92.4 | |
| CalibraEvalModel=Qwen3-8B2026.03 | 90.1 | 91 | 89.8 | |
| UniBiasModel=Qwen3-8B2026.03 | 89.9 | 94.1 | 91.8 | |
| PA-GRPOModel=Llama-3.1-8B2026.03 | 89.3 | 92.9 | 92.6 | |
| GRPOModel=Llama-3.1-8B2026.03 | 89 | 92.1 | 91.5 | |
| Regex2026.04 | 89 | — | — | |
| UniBiasModel=Llama-3.1-8B2026.03 | 80.4 | 90 | 83.6 | |
| PriDeModel=Llama-3.1-8B2026.03 | 79.1 | 83 | 79 | |
| CalibraEvalModel=Llama-3.1-8B2026.03 | 74.4 | 71 | 68.3 | |
| PIFModel=Llama-3.1-8B2026.03 | 73.3 | 83 | 78.8 | |
| BaseModel=Llama-3.1-8B2026.03 | 73 | 82.5 | 78.9 | |
| LLM-Judgebackbone=Qwen-3 0.6B2026.04 | 50.2 | — | — |