Multilingual Reward Modeling on MM-Eval Avg. 18 lang
87.53AccuracyDIBJudge-Qwen3-8B
Evaluation Results
| Method | Links | |
|---|---|---|
| DIBJudge-Qwen3-8BBackbone=Qwen3-8B2026.03 | 87.53 | |
| mR3-Qwen3-8BModel Category=Multilingual Open Reward Models2026.03 | 85.29 | |
| DIBJudge-Qwen3-4BBackbone=Qwen3-4B2026.03 | 85.16 | |
| mR3-Qwen3-4BModel Category=Multilingual Open Reward Models2026.03 | 82.55 | |
| Qwen3-8BModel Category=General Open Models2026.03 | 82.2 | |
| Qwen3-4BModel Category=General Open Models2026.03 | 80.85 | |
| Gemini-2.5-FlashModel Category=Proprietary Models2026.03 | 77.47 | |
| Nemotron-Multi-49BModel Category=Multilingual Open Reward Models2026.03 | 76.31 | |
| Think-as-Locals 7BModel Category=Multilingual Open Reward Models2026.03 | 72.95 | |
| GPT-4oModel Category=Proprietary Models2026.03 | 71.85 | |
| M-PROMETHEUS 7BModel Category=Multilingual Open Reward Models2026.03 | 69.38 | |
| Qwen2.5-7B-InstructModel Category=General Open Models2026.03 | 65.64 | |
| M-PROMETHEUS 3BModel Category=Multilingual Open Reward Models2026.03 | 64.17 | |
| Qwen2.5-3B-InstructModel Category=General Open Models2026.03 | 57.99 |