Multimodal Reward Modeling on MM-RLHF-RewardBench
92.4Pairwise AccuracyMolmo2-4B Multi-response RM
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Molmo2-4B Multi-response RMSize=4B2026.04 | 92.4 | — | |
| MM-RLHF-RewardSize=7B2026.04 | 85 | — | |
| Qwen3-VL-4B Multi-response RMSize=4B2026.04 | 84.7 | — | |
| InternVL3-78BSize=78B2026.04 | 81.8 | — | |
| R1-RewardSize=7B2026.04 | 80.6 | — | |
| Qwen3-VL-4BSize=4B2026.04 | 80 | — | |
| Qwen3-VL-32BSize=32B2026.04 | 78.8 | — | |
| Qwen2.5-VL-7BSize=7B2026.04 | 77.6 | — | |
| LLaVA-CriticSize=7B2026.04 | 77.6 | — | |
| Qwen3-VL-8BSize=8B2026.04 | 73.5 | — | |
| Molmo2-4BSize=4B2026.04 | 73.5 | — | |
| Skywork-VL-RewardSize=7B2026.04 | 72.4 | — | |
| GPT-52026.04 | 71.8 | — | |
| IXC-2.5-RewardSize=7B2026.04 | 71.2 | — | |
| Gemini-2.5-Pro2026.04 | 70.6 | — | |
| Claude-Sonnet-4.52026.04 | 70 | — | |
| InternVL3-8BSize=8B2026.04 | 69.4 | — | |
| Molmo2-8BSize=8B2026.04 | 68.2 | — | |
| BaseReward2026.04 | — | 91.8 | |
| Claude-3.7-Sonnet (2025-02-24)2026.02 | — | 82.35 | |
| DT2IT-MRM2026.04 | — | 89.4 | |
| EGT# Param=7B2026.02 | — | 85.88 | |
| GPT-4o (2024-08-06)2026.02 | — | 58.23 | |
| GPT-5.22026.04 | — | 68.2 | |
| IXC-2.5-Reward# Param=7B2026.02 | — | 71.18 | |
| MM-RLHF-Reward# Param=7B2026.02 | — | 82 | |
| Qwen2-VL-72B# Param=72B2026.02 | — | 48.23 | |
| R1-Reward# Param=7B2026.02 | — | 80.59 | |
| Skywork-VL Reward2026.04 | — | 65.9 | |
| SliME# Param=7B2026.02 | — | 17.1 | |
| VITA-1.5# Param=7B2026.02 | — | 20.58 |