Reward Modeling on RewardBench English
91.01AccuracyDIBJudge-Qwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| DIBJudge-Qwen3-8BBackbone=Qwen3-8B2026.03 | 91.01 | |
| DIBJudge-Qwen3-4BBackbone=Qwen3-4B2026.03 | 90.32 | |
| mR3-Qwen3-8BModel Category=Multilingual Open Reward Models2026.03 | 90.1 | |
| mR3-Qwen3-4BModel Category=Multilingual Open Reward Models2026.03 | 89.75 | |
| Nemotron-Multi-49BModel Category=Multilingual Open Reward Models2026.03 | 89.71 | |
| Gemini-2.5-FlashModel Category=Proprietary Models2026.03 | 88.83 | |
| Qwen3-8BModel Category=General Open Models2026.03 | 88.81 | |
| Think-as-Locals 7BModel Category=Multilingual Open Reward Models2026.03 | 88.79 | |
| Qwen3-4BModel Category=General Open Models2026.03 | 87.54 | |
| GPT-4oModel Category=Proprietary Models2026.03 | 85.96 | |
| Qwen2.5-7B-InstructModel Category=General Open Models2026.03 | 78.59 | |
| M-PROMETHEUS 7BModel Category=Multilingual Open Reward Models2026.03 | 76.69 | |
| M-PROMETHEUS 3BModel Category=Multilingual Open Reward Models2026.03 | 69.79 | |
| Qwen2.5-3B-InstructModel Category=General Open Models2026.03 | 68.99 |