Preference Evaluation on Medical
8.58Avg ScoreOurs (Homo.)
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Ours (Homo.)Reward Model Setting=Homogeneous2026.01 | 8.58 | 94.55 | 8.33 | |
| PluralisticReward Model Setting=Homogeneous2026.01 | 8.32 | 92.5 | 7.93 | |
| Ours (Hete.)Reward Model Setting=Heterogeneous2026.01 | 8.25 | 92.5 | 7.73 | |
| FedAvgReward Model Setting=Homogeneous2026.01 | 8.25 | 94.04 | 7.86 | |
| RM1Reward Model Setting=Homogeneous, Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 8 | 91.82 | 7.58 | |
| Random SelectionReward Model Setting=Homogeneous2026.01 | 7.59 | 88.93 | 6.93 | |
| RM2Reward Model Setting=Heterogeneous, Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 7.52 | 88.25 | 6.83 | |
| RM2Reward Model Setting=Homogeneous, Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 7.52 | 88.25 | 6.83 | |
| Avg RMReward Model Setting=Heterogeneous2026.01 | 7.4 | 86.52 | 6.66 | |
| Oracle RMReward Model Setting=Homogeneous2026.01 | 6.94 | 87.22 | 6.18 | |
| RM0Reward Model Setting=Homogeneous, Backbone=Qwen2.5-VL-3B-Instruct2026.01 | 6.85 | 83.65 | 6.28 | |
| Random SelectionReward Model Setting=Heterogeneous2026.01 | 6.28 | 74.96 | 5.44 | |
| RM0Reward Model Setting=Heterogeneous, Backbone=Qwen2-VL-2B-Instruct2026.01 | 5.55 | 65.59 | 4.66 | |
| RM1Reward Model Setting=Heterogeneous, Backbone=llava-onevision-0.5b2026.01 | 3.13 | 46.51 | 2.43 |