Discriminative Hallucination Evaluation on AMBER-d (Acc, F1)
89.5F1 ScoreUE-DPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UE-DPOBackbone=Qwen2.5-VL-3B, Datasize=5.7k2026.05 | 89.5 | 85.1 | |
| DPOBackbone=Qwen2.5-VL-3B, Datasize=5.7k2026.05 | 88.9 | 86.2 | |
| UE-DPOBackbone=LLaVA-v1.5-13B, Datasize=5.7k2026.05 | 88.2 | 83.5 | |
| TPOBackbone=LLaVA-v1.5-13B, Datasize=5.7k2026.05 | 88 | 83.9 | |
| UE-DPOBackbone=LLaVA-v1.5-7B, Datasize=16k, Training Data Source=RLAIF-V Data2026.05 | 87 | 81.7 | |
| Qwen2.5-VL-3BBackbone=Qwen2.5-VL-3B2026.05 | 86 | 90 | |
| UE-DPOBackbone=LLaVA-v1.5-7B, Datasize=5.7k, Training Data Source=RLHF-V Data2026.05 | 85.7 | 79.1 | |
| TPOBackbone=LLaVA-v1.5-7B, Datasize=5.7k2026.05 | 85 | 79.3 | |
| YARDBase Model=LLaVA-1.5-7B2026.05 | 84.1 | 78.7 | |
| EVASBase Model=LLaVA-1.5-7B2026.05 | 83.81 | 77.93 | |
| V-DPOBackbone=LLaVA-v1.5-7B, Datasize=5.7k2026.05 | 81.6 | — | |
| ICDBase Model=LLaVA-1.5-7B2026.05 | 81.58 | 75.92 | |
| YARDBase Model=InstructBLIP2026.05 | 79.07 | 73.62 | |
| AVISCBase Model=InstructBLIP2026.05 | 78.6 | 72.6 | |
| VCDBase Model=InstructBLIP2026.05 | 75.9 | 69.65 | |
| AVISCBase Model=LLaVA-1.5-7B2026.05 | 75.45 | 70.7 | |
| POVIDBackbone=LLaVA-v1.5-7B, Datasize=17k2026.05 | 74.7 | 71.9 | |
| InstructBLIPBase Model=InstructBLIP2026.05 | 74.6 | 68.2 | |
| LLaVA-v1.5-7BBackbone=LLaVA-v1.5-7B2026.05 | 74.3 | 71.7 | |
| LLaVA-v1.5-13BBackbone=LLaVA-v1.5-13B2026.05 | 73.1 | 71.3 | |
| LLaVA-1.5-7BBase Model=LLaVA-1.5-7B2026.05 | 71.1 | 67 | |
| VCDBase Model=LLaVA-1.5-7B2026.05 | 71.1 | 67.3 | |
| M3IDBase Model=LLaVA-1.5-7B2026.05 | 70.9 | 67.25 |