Multimodal Reward Modeling on MR2Bench Video
50.7Best-of-4 AccuracyMolmo2-4B Multi-response RM
Evaluation Results
| Method | Links | |
|---|---|---|
| Molmo2-4B Multi-response RMSize=4B2026.04 | 50.7 | |
| GPT-52026.04 | 50.1 | |
| Qwen3-VL-32BSize=32B2026.04 | 49.9 | |
| Gemini-2.5-Pro2026.04 | 49.7 | |
| Claude-Sonnet-4.52026.04 | 49.1 | |
| IXC-2.5-RewardSize=7B2026.04 | 48.7 | |
| Qwen3-VL-4BSize=4B2026.04 | 47.9 | |
| Qwen3-VL-8BSize=8B2026.04 | 47.7 | |
| InternVL3-78BSize=78B2026.04 | 47.7 | |
| Qwen3-VL-4B Multi-response RMSize=4B2026.04 | 47.5 | |
| Skywork-VL-RewardSize=7B2026.04 | 46.7 | |
| R1-RewardSize=7B2026.04 | 44.9 | |
| Qwen2.5-VL-7BSize=7B2026.04 | 44.4 | |
| Molmo2-4BSize=4B2026.04 | 43.2 | |
| Molmo2-8BSize=8B2026.04 | 42.6 | |
| InternVL3-8BSize=8B2026.04 | 40.4 | |
| LLaVA-CriticSize=7B2026.04 | 40.2 | |
| MM-RLHF-RewardSize=7B2026.04 | 36.6 |