Multimodal Reward Modeling on Multimodal RewardBench
88.79AccuracyGemini 3.1 Pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini 3.1 ProModel Category=Proprietary Frontier VLMs2026.04 | 88.79 | — | |
| Gemini 3.0 FlashModel Category=Proprietary Frontier VLMs2026.04 | 87.9 | — | |
| Gemini-2.5-ProAccessibility=Proprietary2026.02 | 85.4 | — | |
| EGT# Param=7B2026.02 | 84.3 | — | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 83.02 | — | |
| Gemini-2.5-FlashAccessibility=Proprietary2026.02 | 82.5 | — | |
| Gemini 3.1 Flash-LiteModel Category=Proprietary Frontier VLMs2026.04 | 82.25 | — | |
| Claude 4.6 OpusModel Category=Proprietary Frontier VLMs2026.04 | 82.23 | — | |
| R1-Reward# Param=7B2026.02 | 82.2 | — | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 82.06 | — | |
| GPT-5.4Model Category=Proprietary Frontier VLMs2026.04 | 81.91 | — | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 81.19 | — | |
| DT2IT-MRM (Qwen3-VL)Model Category=Ours, #Param=8B2026.04 | 79.5 | 79.3 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 79.35 | — | |
| DT2IT-MRM (Qwen2.5-VL)Model Category=Ours, #Param=7B2026.04 | 77.7 | 77.7 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 75.82 | — | |
| Skywork-VL RewardModel Category=Open-source Specialist RMs2026.04 | 74.25 | — | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 72.49 | — | |
| Claude-3.7-Sonnet (2025-02-24)2026.02 | 71.9 | — | |
| GPT-4oAccessibility=Proprietary2026.02 | 71.5 | — | |
| Omni-RewardModel-BTModel Category=Discriminative Multimodal Reward Models, #Param=8B2026.04 | 71.3 | 70.5 | |
| Qwen2-VL-72B# Param=72B2026.02 | 70.9 | — | |
| GPT-4o (2024-08-06)2026.02 | 70.8 | — | |
| IXC-2.5-RewardModel Category=Open-source Specialist RMs2026.04 | 69.12 | — | |
| Skywork-VL Reward*Model Category=Discriminative Multimodal Reward Models, #Param=7B2026.04 | 67.9 | 74.4 | |
| MM-RLHF-Reward# Param=7B2026.02 | 67.1 | — | |
| IXC-2.5-Reward# Param=7B2026.02 | 66.6 | — | |
| PhyCritic-7BAccessibility=Open-Source, Parameters=7B, Base Model=Qwen2.5-VL-7B-Instruct2026.02 | 65.9 | — | |
| UnifiedReward*Model Category=Fast-Thinking Generative MRMs, critic training status=with, #Param=7B2026.04 | 65.7 | 65.7 | |
| BaseReward (Qwen2.5-VL)Model Category=Discriminative Multimodal Reward Models, #Param=7B2026.04 | 65.7 | 72.8 | |
| UnifiedReward-Think*Model Category=Slow-Thinking Generative MRMs, critic training status=with, #Param=7B2026.04 | 65.2 | 62.1 | |
| Eagle-2.5-8BAccessibility=Open-Source, Parameters=8B2026.02 | 64.4 | — | |
| Qwen2.5-VL-7BAccessibility=Open-Source, Parameters=7B2026.02 | 64 | — | |
| Gemini-1.5-ProModel Category=Proprietary Models, critic training status=without, #Param=-2026.04 | 63.5 | 71.9 | |
| GPT-4oModel Category=Proprietary Models, critic training status=without, #Param=-2026.04 | 62.6 | 70.8 | |
| Claude-3.5-SonnetModel Category=Proprietary Models, critic training status=without, #Param=-2026.04 | 62.6 | 71.5 | |
| MM-RLHF-RewardModel Category=Semi-Scalar Multimodal Reward Models, #Param=7B2026.04 | 61.7 | 67.1 | |
| GPT-5.2*Model Category=Proprietary Models, critic training status=without, #Param=-2026.04 | 60.7 | 75.3 | |
| IXC-2.5-RewardModel Category=Discriminative Multimodal Reward Models, #Param=7B2026.04 | 60.7 | 66.6 | |
| LLaVA-Critic*Model Category=Fast-Thinking Generative MRMs, critic training status=with, #Param=8B2026.04 | 60.7 | 48.9 | |
| Llama-3.2-Vision-InstructModel Category=Open-Source Models, critic training status=without, #Param=90B2026.04 | 60 | 61.2 | |
| InternVL3-8BModel Category=Open-Source Models, critic training status=without, #Param=8B2026.04 | 59.6 | 63.6 | |
| Claude-3.7-SonnetModel Category=Proprietary Models, critic training status=without, #Param=-2026.04 | 58.4 | 71.9 | |
| Llama-3.2-Vision-InstructModel Category=Open-Source Models, critic training status=without, #Param=11B2026.04 | 57.8 | 51.2 | |
| Qwen2-VL-72B-InstructModel Category=Open-Source Models, critic training status=without, #Param=72B2026.04 | 56.4 | 70.9 | |
| Cosmos-R1-7BAccessibility=Open-Source, Parameters=7B2026.02 | 54.8 | — | |
| VITA-1.5# Param=7B2026.02 | 53.6 | — | |
| Robobrain2.0-7BAccessibility=Open-Source, Parameters=7B2026.02 | 50.5 | — | |
| R1-Reward*Model Category=Slow-Thinking Generative MRMs, critic training status=with, #Param=7B2026.04 | 47 | 53 | |
| SliME# Param=7B2026.02 | 42 | — |