Multiple Choice Question Answering on Long-form Multiple Choice Question Answering benchmark
83.2AccuracyQwen2.5-VL
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VLTraining Paradigm=Rank2026.03 | 83.2 | |
| Qwen2.5-VLTraining Paradigm=DPO2026.03 | 82.6 | |
| Qwen2.5-VLTraining Paradigm=MPO2026.03 | 82.5 | |
| Qwen2.5-VLTraining Paradigm=Pretrained2026.03 | 82 | |
| Qwen2.5-VLTraining Paradigm=SFT2026.03 | 81.9 | |
| PerceptionLMTraining Paradigm=DPO2026.03 | 64.4 | |
| PerceptionLMTraining Paradigm=Rank2026.03 | 64.4 | |
| PerceptionLMTraining Paradigm=MPO2026.03 | 64.2 | |
| PerceptionLMTraining Paradigm=SFT2026.03 | 61.9 | |
| PerceptionLMTraining Paradigm=Pretrained2026.03 | 61.8 |