Multimodal Reward Modeling on Multimodal Reward Bench
85.62Reward Bench ScoreProxy-GRM-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Proxy-GRM-RLProxy Agent=Proxy-SFT, Data Size=50k2026.03 | 85.62 | |
| Proxy-GRM-RLProxy Agent=None, Data Size=45k2026.03 | 85.28 | |
| Proxy-GRM-SFTProxy Agent=None, Data Size=10k2026.03 | 85.18 | |
| Proxy-GRM-RLProxy Agent=Proxy-RL, Data Size=60k2026.03 | 84.78 | |
| R1-RewardProxy Agent=None, Data Size=>200k2026.03 | 82.2 | |
| Claude-3.7-SonnetProxy Agent=None, Data Size=-2026.03 | 71.9 | |
| Claude-3.5-Sonnet-(2024-06-22)Proxy Agent=None, Data Size=-2026.03 | 71.5 | |
| Qwen2-VL-72BProxy Agent=None, Data Size=-2026.03 | 70.9 | |
| GPT-4o-(2024-08-06)Proxy Agent=None, Data Size=-2026.03 | 70.8 | |
| IXC-2.5-RewardProxy Agent=None, Data Size=>200k2026.03 | 66.6 | |
| VITA-1.5Proxy Agent=None, Data Size=-2026.03 | 53.6 | |
| SliMEProxy Agent=None, Data Size=-2026.03 | 42 |