RLHF on HH-RLHF
74Human Win RateDoubao-1.5-Vision-Pro
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Doubao-1.5-Vision-ProEval set=HH-RLHF, Category=Proprietary2026.01 | 74 | — | — | |
| GPT-4o-miniEval set=HH-RLHF, Category=Proprietary2026.01 | 73.1 | — | — | |
| Gemini-2.0-FlashEval set=HH-RLHF, Category=Proprietary2026.01 | 72.9 | — | — | |
| R1-Reward-7BEval set=HH-RLHF, Category=Open-source reward model, Parameters=7B2026.01 | 71.8 | — | — | |
| Qwen2.5-VL-7B-instructEval set=HH-RLHF, Category=Open-source backbone, Parameters=7B2026.01 | 70.8 | — | — | |
| Skywork-VL-Reward-7BEval set=HH-RLHF, Category=Open-source reward model, Parameters=7B2026.01 | 70.4 | — | — | |
| Omni-RRM-7B (SFT+RL)Eval set=HH-RLHF, Training Stage=SFT+RL, Parameters=7B2026.01 | 69.8 | — | — | |
| DPPO2023.01 | 69.7 | 4.515 | 0.0083 | |
| Omni-RRM-3B (SFT+RL)Eval set=HH-RLHF, Training Stage=SFT+RL, Parameters=3B2026.01 | 68.6 | — | — | |
| UnifiedReward-think-qwen-7BEval set=HH-RLHF, Category=Open-source reward model, Parameters=7B2026.01 | 68.3 | — | — | |
| Omni-RRM-7B (SFT)Eval set=HH-RLHF, Training Stage=SFT, Parameters=7B2026.01 | 68.3 | — | — | |
| LLaVA-Critic-7BEval set=HH-RLHF, Category=Open-source reward model, Parameters=7B2026.01 | 68.2 | — | — | |
| Omni-RRM-3B (SFT)Eval set=HH-RLHF, Training Stage=SFT, Parameters=3B2026.01 | 67.9 | — | — | |
| Qwen2.5-Omni-7BEval set=HH-RLHF, Category=Open-source backbone, Parameters=7B2026.01 | 67.6 | — | — | |
| PPO2023.01 | 66.7 | 4.335 | 0.0091 | |
| Qwen2.5-Omni-3BEval set=HH-RLHF, Category=Open-source backbone, Parameters=3B2026.01 | 63.5 | — | — |