LLM-as-a-Judge on JudgeBench
84.19AccuracyDeepSeek-V3
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| DeepSeek-V32026.01 | 84.19 | — | — | |
| Qwen3-30B-A3B-Thinking-2507Parameters=30B, Active Parameters=3B, Mode=Thinking, Version=25072026.01 | 83.87 | — | — | |
| Qwen3-Next-80B-A3B-ThinkingParameters=80B, Active Parameters=3B, Mode=Thinking2026.01 | 82.42 | — | — | |
| DeepSeek-R12026.01 | 80.48 | — | — | |
| QwQ-32BParameters=32B2026.01 | 79.75 | — | — | |
| Qwen3-Next-80B-A3B-InstructParameters=80B, Active Parameters=3B, Mode=Instruct2026.01 | 79.45 | — | — | |
| Qwen3-30B-A3B-Instruct-2507Parameters=30B, Active Parameters=3B, Mode=Instruct, Version=25072026.01 | 74 | — | — | |
| PIFModel=Qwen3-32B2026.03 | 62.2 | 68.4 | 36.9 | |
| GRPOModel=Qwen3-32B2026.03 | 61.4 | 74.2 | 45.1 | |
| Qwen2.5-32B-InstructParameters=32B, Mode=Instruct2026.01 | 60.4 | — | — | |
| PA-GRPOModel=Qwen3-8B2026.03 | 60.1 | 70 | 45.3 | |
| PA-GRPOModel=Qwen3-32B2026.03 | 59.4 | 75.2 | 43.4 | |
| PA-GRPOModel=Llama-3.1-8B2026.03 | 57.1 | 58.3 | 32.4 | |
| PriDeModel=Qwen3-32B2026.03 | 56.8 | 63.5 | 33.1 | |
| UniBiasModel=Qwen3-32B2026.03 | 56.2 | 64 | 32.5 | |
| BaseModel=Qwen3-32B2026.03 | 55.4 | 62.1 | 29.7 | |
| PIFModel=Qwen3-8B2026.03 | 54.3 | 59.6 | 37.4 | |
| PIFModel=Llama-3.1-8B2026.03 | 53.3 | 59.2 | 30.4 | |
| CalibraEvalModel=Qwen3-32B2026.03 | 52.9 | 61 | 28.9 | |
| UniBiasModel=Qwen3-8B2026.03 | 52.2 | 26.1 | 14.9 | |
| PriDeModel=Qwen3-8B2026.03 | 51.2 | 48.8 | 29.8 | |
| GRPOModel=Qwen3-8B2026.03 | 50.4 | 62.6 | 34.8 | |
| UniBiasModel=Llama-3.1-8B2026.03 | 50.2 | 23 | 10.9 | |
| CalibraEvalModel=Qwen3-8B2026.03 | 49.7 | 56.4 | 31.3 | |
| CalibraEvalModel=Llama-3.1-8B2026.03 | 49.3 | 15.7 | 7.1 | |
| PriDeModel=Llama-3.1-8B2026.03 | 49.1 | 16.2 | 7.2 | |
| GRPOModel=Llama-3.1-8B2026.03 | 48.2 | 56.1 | 28.2 | |
| BaseModel=Qwen3-8B2026.03 | 43.9 | 45.5 | 16.5 | |
| BaseModel=Llama-3.1-8B2026.03 | 35 | 34.8 | 6.1 |