Preference Evaluation on OCR-like
9.06Average ScoreOurs (Homo.)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ours (Homo.)Reward Model Setting=Homogeneous2026.01 | 9.06 | 91.54 | 8.86 | |
| FedAvgReward Model Setting=Homogeneous2026.01 | 9.05 | 92.54 | 8.9 | |
| PluralisticReward Model Setting=Homogeneous2026.01 | 8.77 | 89.21 | 8.37 | |
| Avg RMReward Model Setting=Heterogeneous2026.01 | 8.76 | 90.09 | 8.41 | |
| Ours (Hete.)Reward Model Setting=Heterogeneous2026.01 | 8.73 | 87.23 | 8.27 | |
| RM1Reward Model Setting=Homogeneous2026.01 | 8.69 | 89.08 | 8.21 | |
| Random SelectionReward Model Setting=Homogeneous2026.01 | 8.68 | 88.79 | 8.22 | |
| Oracle RMReward Model Setting=Homogeneous2026.01 | 8.62 | 85.32 | 8.28 | |
| RM0Reward Model Setting=Homogeneous2026.01 | 8.46 | 86.19 | 8.24 | |
| RM2Reward Model Setting=Heterogeneous, Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 8.21 | 65.2 | 7.58 | |
| RM2Reward Model Setting=Homogeneous2026.01 | 8.21 | 65.2 | 7.58 | |
| Random SelectionReward Model Setting=Heterogeneous2026.01 | 7.52 | 74.03 | 6.37 | |
| RM0Reward Model Setting=Heterogeneous, Backbone=Qwen2-VL-2B-Instruct2026.01 | 7.38 | 70.01 | 6.38 | |
| RM1Reward Model Setting=Heterogeneous, Backbone=llava-onevision-0.5b2026.01 | 6.51 | 63.85 | 6.59 |