Cross-modal hallucination evaluation on AVHBench
88.19Overall AccuracyQwen 2.5 Omni + MoD-DPO++
Evaluation Results
| Method | Links | ||||||
|---|---|---|---|---|---|---|---|
| Qwen 2.5 Omni + MoD-DPO++Reference Model=Qwen 2.5 Omni, Optimization Method=MoD-DPO++2026.03 | 88.19 | — | — | 86.35 | 90.02 | 88.15 | |
| Qwen 2.5 Omni + MoD-DPOReference Model=Qwen 2.5 Omni, Optimization Method=MoD-DPO2026.03 | 87.66 | — | — | 85.53 | 89.78 | 87.61 | |
| MiniCPM-O 2.6 + MoD-DPO++Reference Model=MiniCPM-O 2.6, Optimization Method=MoD-DPO++2026.03 | 87.26 | — | — | 88.89 | 85.63 | 87.23 | |
| MiniCPM-O 2.6 + MoD-DPOReference Model=MiniCPM-O 2.6, Optimization Method=MoD-DPO2026.03 | 87.08 | — | — | 89.28 | 84.87 | 87.02 | |
| Qwen 2.5 Omni + OmniDPOReference Model=Qwen 2.5 Omni, Optimization Method=OmniDPO2026.03 | 85.34 | — | — | 75.61 | 95.06 | 84.23 | |
| MiniCPM-O 2.6 + OmniDPOReference Model=MiniCPM-O 2.6, Optimization Method=OmniDPO2026.03 | 84.96 | — | — | 86.18 | 83.75 | 84.95 | |
| Qwen 2.5 Omni + DPOReference Model=Qwen 2.5 Omni, Optimization Method=DPO2026.03 | 84.39 | — | — | 75.44 | 93.3 | 83.42 | |
| Qwen 2.5 OmniReference Model=Qwen 2.5 Omni2026.03 | 84.15 | — | — | 76.76 | 91.55 | 83.51 | |
| Qwen 3 OmniReference Model=Qwen 3 Omni2026.03 | 83.54 | — | — | 85.92 | 81.17 | 83.47 | |
| MiniCPM-O 2.6Reference Model=MiniCPM-O 2.62026.03 | 83.36 | — | — | 85.56 | 81.16 | 83.3 | |
| MiniCPM-O 2.6 + DPOReference Model=MiniCPM-O 2.6, Optimization Method=DPO2026.03 | 82.91 | — | — | 84.56 | 81.26 | 82.88 | |
| Qwen2.5-Omni-7B + MADBase Model=Qwen2.5-Omni-7B, Decoding Strategy=MAD2026.01 | 81.6 | 78.7 | 84.4 | — | — | — | |
| VideoLLaMA2-AV + MADBase Model=VideoLLaMA2-AV, Decoding Strategy=MAD2026.01 | 79.4 | 79.7 | 79.1 | — | — | — | |
| VideoLLaMA2-AV + AVCDBase Model=VideoLLaMA2-AV, Decoding Strategy=AVCD2026.01 | 79.3 | 78.3 | 80.3 | — | — | — | |
| VideoLLaMA 2Reference Model=VideoLLaMA 22026.03 | 79.23 | — | — | 81.51 | 76.94 | 79.16 | |
| Qwen2.5-Omni-7B + AVCDBase Model=Qwen2.5-Omni-7B, Decoding Strategy=AVCD2026.01 | 77.8 | 75.8 | 79.7 | — | — | — | |
| VideoLLaMA2-AVBase Model=VideoLLaMA2-AV, Decoding Strategy=Original decoding (Base)2026.01 | 77.4 | 75.7 | 79 | — | — | — | |
| Qwen2.5-Omni-7BBase Model=Qwen2.5-Omni-7B, Decoding Strategy=Original decoding (Base)2026.01 | 76.9 | 73 | 80.7 | — | — | — | |
| Qwen2.5-Omni-7B + VCDExtendedBase Model=Qwen2.5-Omni-7B, Decoding Strategy=VCD-Extended2026.01 | 73.7 | 70.3 | 77.1 | — | — | — | |
| VideoLLaMA2-AV + VCDExtendedBase Model=VideoLLaMA2-AV, Decoding Strategy=VCD-Extended2026.01 | 70.4 | 66 | 74.8 | — | — | — | |
| VITA-1.5Reference Model=VITA-1.52026.03 | 67.17 | — | — | 78.17 | 56.17 | 65.36 | |
| OmniVinciReference Model=OmniVinci2026.03 | 61.36 | — | — | 57.92 | 64.79 | 61.16 |