MLLM-as-a-Judge Evaluation on RewardBench Multimodal
80.1AccuracyR1-Reward
Evaluation Results
| Method | Links | |
|---|---|---|
| R1-Reward2026.02 | 80.1 | |
| Qwen3-VL-8B-Instruct2026.02 | 65.74 | |
| M-Judger-SFT-Qwen8B2026.02 | 65.67 | |
| M-Judger-RL-Qwen8B2026.02 | 65.52 | |
| M-Judger-SFT-Qwen4B2026.02 | 65.43 | |
| M-Judger-RL-Qwen4B2026.02 | 65.43 | |
| Qwen3-VL-8B-InstructTraining=+ SFT (only open-source)2026.02 | 65.41 | |
| Qwen3-VL-4B-InstructTraining=+ SFT (only open-source)2026.02 | 64.81 | |
| Qwen3-VL-4B-Instruct2026.02 | 62.98 | |
| UnifiedReward-Think-qwen-7b2026.02 | 62.03 |