Reward Modeling on VL-RewardBench
86.45AccuracyGemini 3.1 Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini 3.1 ProModel Category=Proprietary Frontier VLMs2026.04 | 86.45 | |
| Gemini 3.0 FlashModel Category=Proprietary Frontier VLMs2026.04 | 85.89 | |
| Gemini 3.1 Flash-LiteModel Category=Proprietary Frontier VLMs2026.04 | 81.4 | |
| GPT-5.4Model Category=Proprietary Frontier VLMs2026.04 | 78.27 | |
| Claude 4.6 OpusModel Category=Proprietary Frontier VLMs2026.04 | 74.42 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 73.54 | |
| Skywork-VL RewardModel Category=Open-source Specialist RMs2026.04 | 73.54 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Rubric2026.04 | 72.49 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 72.15 | |
| Qwen3-VL-32B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 70.73 | |
| IXC-2.5-RewardModel Category=Open-source Specialist RMs2026.04 | 66.64 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=Vanilla2026.04 | 65.52 | |
| Qwen3-VL-30B-A3B-InstructModel Category=Open-source Generalist VLMs, Prompting Strategy=CoT2026.04 | 60.22 |