Multiple Choice Questions on GPQA
93.5AccuracyBERT-Judge
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| BERT-Judgeclean_name=BERT-as-a-Judge2026.04 | 93.5 | — | — | |
| Regex2026.04 | 86.5 | — | — | |
| LLM-Judgebackbone=Qwen-3 0.6B2026.04 | 66.2 | — | — | |
| PA-GRPOModel=Qwen3-32B2026.03 | 54.1 | 75.1 | 61.2 | |
| GRPOModel=Qwen3-32B2026.03 | 53.2 | 74.3 | 59.9 | |
| PIFModel=Qwen3-32B2026.03 | 52.1 | 72.8 | 60.1 | |
| PriDeModel=Qwen3-32B2026.03 | 49.7 | 73.1 | 58.5 | |
| CalibraEvalModel=Qwen3-32B2026.03 | 48 | 72.2 | 55.2 | |
| UniBiasModel=Qwen3-32B2026.03 | 46.9 | 68.9 | 54.5 | |
| PA-GRPOModel=Qwen3-8B2026.03 | 42.3 | 72.4 | 56.7 | |
| GRPOModel=Qwen3-8B2026.03 | 40.4 | 63.2 | 43.8 | |
| BaseModel=Qwen3-32B2026.03 | 40.4 | 59.9 | 46.7 | |
| UniBiasModel=Qwen3-8B2026.03 | 34.6 | 54.3 | 34.2 | |
| PriDeModel=Qwen3-8B2026.03 | 34.4 | 56.9 | 38.5 | |
| CalibraEvalModel=Qwen3-8B2026.03 | 33.5 | 49.8 | 32.9 | |
| PIFModel=Qwen3-8B2026.03 | 32.7 | 68.7 | 46.6 | |
| BaseModel=Qwen3-8B2026.03 | 32.5 | 48.2 | 30.4 | |
| UniBiasModel=Llama-3.1-8B2026.03 | 32.3 | 56.1 | 31.8 | |
| PA-GRPOModel=Llama-3.1-8B2026.03 | 32.1 | 57.2 | 33.2 | |
| PriDeModel=Llama-3.1-8B2026.03 | 31 | 49.1 | 27.4 | |
| GRPOModel=Llama-3.1-8B2026.03 | 29.5 | 55.6 | 29.7 | |
| PIFModel=Llama-3.1-8B2026.03 | 29.1 | 49.7 | 29.2 | |
| CalibraEvalModel=Llama-3.1-8B2026.03 | 28.3 | 48.2 | 26.5 | |
| BaseModel=Llama-3.1-8B2026.03 | 27.3 | 40 | 27.2 |