Reward Modeling on MMRB 2
70.3Single-turn ScoreJRM
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| JRMevaluation_mode=Pointwise2026.02 | 70.3 | 64.6 | 69.3 | |
| EditRewardevaluation_mode=Pointwise2026.02 | 67.2 | 59 | 65.7 | |
| SFReward (Ours)Type=Gen.2026.06 | 62.9 | 55.1 | 61.5 | |
| GPT-5evaluation_mode=Pointwise2026.02 | 62.7 | 58.4 | 61.9 | |
| Gemini-3.0-Flashevaluation_mode=Pointwise2026.02 | 62.7 | 59.6 | 62.1 | |
| GPT-5Type=Closed2026.06 | 62.7 | 58.4 | 61.9 | |
| Gemini-3.0-FlashType=Closed2026.06 | 62.7 | 59.6 | 62.1 | |
| Gemini-3.0-Proevaluation_mode=Pointwise2026.02 | 59.4 | 57.3 | 59 | |
| w/o Dense Anno. (Ours)Type=Gen.2026.06 | 59.1 | 54.5 | 58.3 | |
| EditScore-8Bevaluation_mode=Pointwise2026.02 | 57.9 | 52.8 | 57 | |
| GPT-4.1Type=Closed2026.06 | 54.7 | 47.8 | 53.5 | |
| Gemini-2.5-Proevaluation_mode=Pointwise2026.02 | 54.5 | 48.3 | 53.4 | |
| Gemini-2.5-ProType=Closed2026.06 | 54.5 | 48.3 | 53.4 | |
| Qwen3-VL-32Bevaluation_mode=Pointwise2026.02 | 46.7 | 46.1 | 46.6 | |
| Qwen3-VL-8Bevaluation_mode=Pointwise2026.02 | 42.5 | 39.3 | 41.9 | |
| Qwen3-VL-8BType=Gen.2026.06 | 42.5 | 39.3 | 41.9 |