Multimodal Reward Modeling on MR2Bench Image
87.1Best-of-4 AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-52026.04 | 87.1 | |
| Claude-Sonnet-4.52026.04 | 72.9 | |
| Gemini-2.5-Pro2026.04 | 71.2 | |
| InternVL3-78BSize=78B2026.04 | 65 | |
| Molmo2-4B Multi-response RMSize=4B2026.04 | 62.5 | |
| Molmo2-4BSize=4B2026.04 | 61.7 | |
| Qwen3-VL-4BSize=4B2026.04 | 60.8 | |
| Qwen3-VL-32BSize=32B2026.04 | 60.8 | |
| Qwen3-VL-8BSize=8B2026.04 | 60.4 | |
| Molmo2-8BSize=8B2026.04 | 60 | |
| R1-RewardSize=7B2026.04 | 58.8 | |
| Qwen3-VL-4B Multi-response RMSize=4B2026.04 | 58.8 | |
| LLaVA-CriticSize=7B2026.04 | 56.3 | |
| InternVL3-8BSize=8B2026.04 | 55.4 | |
| IXC-2.5-RewardSize=7B2026.04 | 55 | |
| Skywork-VL-RewardSize=7B2026.04 | 52.9 | |
| Qwen2.5-VL-7BSize=7B2026.04 | 52.5 | |
| MM-RLHF-RewardSize=7B2026.04 | 45 |