Multilingual Reward Modeling on m-RewardBench Avg. 23 langs
91.37AccuracyDIBJudge-Qwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| DIBJudge-Qwen3-8BBackbone=Qwen3-8B2026.03 | 91.37 | |
| DIBJudge-Qwen3-4BBackbone=Qwen3-4B2026.03 | 89.84 | |
| Nemotron-Multi-49BModel Category=Multilingual Open Reward Models, Parameters=49B2026.03 | 88.83 | |
| mR3-Qwen3-8BModel Category=Multilingual Open Reward Models, Backbone=Qwen3-8B2026.03 | 88.58 | |
| Gemini-2.5-FlashModel Category=Proprietary Models2026.03 | 88.06 | |
| mR3-Qwen3-4BModel Category=Multilingual Open Reward Models, Backbone=Qwen3-4B2026.03 | 87.21 | |
| Qwen3-8BModel Category=General Open Models, Parameters=8B2026.03 | 86.12 | |
| GPT-4oModel Category=Proprietary Models2026.03 | 85.75 | |
| Qwen3-4BModel Category=General Open Models, Parameters=4B2026.03 | 85.06 | |
| Think-as-Locals 7BModel Category=Multilingual Open Reward Models, Parameters=7B2026.03 | 84.51 | |
| M-PROMETHEUS 7BModel Category=Multilingual Open Reward Models, Parameters=7B2026.03 | 78.03 | |
| Qwen2.5-7B-InstructModel Category=General Open Models, Parameters=7B2026.03 | 77.89 | |
| M-PROMETHEUS 3BModel Category=Multilingual Open Reward Models, Parameters=3B2026.03 | 68.45 | |
| Qwen2.5-3B-InstructModel Category=General Open Models, Parameters=3B2026.03 | 66.97 |