Multi-modal Preference Evaluation on Multi-modal Preference Benchmarks Aggregate Overall
72AccuracyGemini-2.5-Pro
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini-2.5-Pro2026.01 | 72 | |
| Omni-RRMModel Scale=7B, Training Stage=sft+rl, Rationale Supervision=yes2026.01 | 71.8 | |
| Gemini-2.0-Flash2026.01 | 67.7 | |
| Omni-RRMModel Scale=3B, Training Stage=sft+rl, Rationale Supervision=yes2026.01 | 65 | |
| Omni-RMModel Scale=7B, Training Stage=sft+rl, Rationale Supervision=no2026.01 | 64.4 | |
| Omni-RRMModel Scale=7B, Training Stage=sft, Rationale Supervision=yes2026.01 | 63.7 | |
| Qwen2.5-OmniModel Scale=7B2026.01 | 61 | |
| Omni-RRMModel Scale=3B, Training Stage=sft, Rationale Supervision=yes2026.01 | 60 | |
| Omni-RMModel Scale=3B, Training Stage=sft+rl, Rationale Supervision=no2026.01 | 58.9 | |
| GPT-4o-mini2026.01 | 58.4 | |
| Qwen2.5-OmniModel Scale=3B2026.01 | 56.1 |