Unimodal-prior-induced hallucination evaluation on CMM
82.3Visual Dom. AccuracyVideoLLaMA2-AV + MAD
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| VideoLLaMA2-AV + MADBase Model=VideoLLaMA2-AV, Decoding Strategy=MAD2026.01 | 82.3 | 84.3 | 77.5 | 81.3 | |
| Qwen2.5-Omni-7B + MADBase Model=Qwen2.5-Omni-7B, Decoding Strategy=MAD2026.01 | 76.8 | 84.3 | 83.3 | 81.4 | |
| VideoLLaMA2-AVBase Model=VideoLLaMA2-AV, Decoding Strategy=Original decoding (Base)2026.01 | 71.8 | 80 | 68.8 | 73.5 | |
| VideoLLaMA2-AV + AVCDBase Model=VideoLLaMA2-AV, Decoding Strategy=AVCD2026.01 | 71.8 | 84 | 71.5 | 75.8 | |
| VideoLLaMA2-AV + VCDExtendedBase Model=VideoLLaMA2-AV, Decoding Strategy=VCD-Extended2026.01 | 71.3 | 83.3 | 74.8 | 76.4 | |
| Qwen2.5-Omni-7B + AVCDBase Model=Qwen2.5-Omni-7B, Decoding Strategy=AVCD2026.01 | 66.3 | 72.8 | 81 | 73.3 | |
| Qwen2.5-Omni-7BBase Model=Qwen2.5-Omni-7B, Decoding Strategy=Original decoding (Base)2026.01 | 64.5 | 72.3 | 81.3 | 72.7 | |
| Qwen2.5-Omni-7B + VCDExtendedBase Model=Qwen2.5-Omni-7B, Decoding Strategy=VCD-Extended2026.01 | 62.5 | 71.3 | 84.5 | 72.8 |