Multimodal Reward Modeling on VideoRewardBench
68.2Macro Pairwise AccuracyGPT-5
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-52026.04 | 68.2 | |
| Claude-Sonnet-4.52026.04 | 67.5 | |
| Molmo2-4B Multi-response RMSize=4B2026.04 | 66.3 | |
| Qwen3-VL-32BSize=32B2026.04 | 65.8 | |
| Qwen3-VL-4BSize=4B2026.04 | 64.9 | |
| Qwen3-VL-4B Multi-response RMSize=4B2026.04 | 64.9 | |
| Gemini-2.5-Pro2026.04 | 63.2 | |
| Skywork-VL-RewardSize=7B2026.04 | 62.9 | |
| Qwen3-VL-8BSize=8B2026.04 | 62 | |
| R1-RewardSize=7B2026.04 | 61.2 | |
| InternVL3-78BSize=78B2026.04 | 58.5 | |
| Molmo2-4BSize=4B2026.04 | 58.2 | |
| InternVL3-8BSize=8B2026.04 | 57.9 | |
| Molmo2-8BSize=8B2026.04 | 57.1 | |
| IXC-2.5-RewardSize=7B2026.04 | 57.1 | |
| Qwen2.5-VL-7BSize=7B2026.04 | 55.3 | |
| MM-RLHF-RewardSize=7B2026.04 | 52.2 | |
| LLaVA-CriticSize=7B2026.04 | 14.7 |