Reward Modeling on MLLM-as-a-Judge (MaaJ)
72.18AccuracyQwen3-VL-32B-Instruct
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 72.18 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 71.83 | |
| Claude 4.6 OpusModel Category=Proprietary Frontier VLMs2026.04 | 71.39 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 70.74 | |
| GPT-5.4Model Category=Proprietary Frontier VLMs2026.04 | 70.35 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 70.2 | |
| IXC-2.5-RewardModel Category=Open-source Specialist RMs2026.04 | 69.15 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 69.13 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 68.93 | |
| Gemini 3.0 FlashModel Category=Proprietary Frontier VLMs2026.04 | 66.6 | |
| Gemini 3.1 ProModel Category=Proprietary Frontier VLMs2026.04 | 66.56 | |
| Gemini 3.1 Flash-LiteModel Category=Proprietary Frontier VLMs2026.04 | 64.31 | |
| Skywork-VL RewardModel Category=Open-source Specialist RMs2026.04 | 59.93 |