Multimodal Reward Modeling on MM-RLHF-Reward Bench
82.94AccuracyProxy-GRM-RL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Proxy-GRM-RLProxy Agent=None, Data Size=45k2026.03 | 82.94 | 56.52 | |
| Proxy-GRM-RLProxy Agent=Proxy-SFT, Data Size=50k2026.03 | 82.94 | 56.52 | |
| Claude-3.7-SonnetProxy Agent=None, Data Size=-2026.03 | 82.35 | 65.22 | |
| Proxy-GRM-RLProxy Agent=Proxy-RL, Data Size=60k2026.03 | 81.76 | 58.7 | |
| R1-RewardProxy Agent=None, Data Size=>200k2026.03 | 80.59 | 54.35 | |
| Proxy-GRM-SFTProxy Agent=None, Data Size=10k2026.03 | 79.41 | 52.17 | |
| IXC-2.5-RewardProxy Agent=None, Data Size=>200k2026.03 | 71.18 | 50 | |
| Claude-3.5-Sonnet-(2024-06-22)Proxy Agent=None, Data Size=-2026.03 | 62.94 | 26.11 | |
| GPT-4o-(2024-08-06)Proxy Agent=None, Data Size=-2026.03 | 58.23 | 26.01 | |
| Qwen2-VL-72BProxy Agent=None, Data Size=-2026.03 | 48.23 | 13.04 | |
| Llama-3.2-90BProxy Agent=None, Data Size=-2026.03 | 35.29 | 10.86 | |
| NVLM-D-72BProxy Agent=None, Data Size=-2026.03 | 34.7 | 6.52 | |
| VITA-1.5Proxy Agent=None, Data Size=-2026.03 | 20.58 | 2.78 | |
| SliMEProxy Agent=None, Data Size=-2026.03 | 17.1 | 1.76 |