Hallucination-oriented Video Understanding on EventHallusion (test)
91.9AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oBackbone Model=GPT-4o, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 91.9 | |
| Gemini 1.5 ProBackbone Model=Gemini 1.5 Pro, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 80.4 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-32B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 78 | |
| Qwen3-VL-32BBackbone Model=Qwen3-VL-32B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 77 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-8B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 73.4 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-4B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 72 | |
| SeasonBackbone Model=Qwen3-VL-8B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 71.6 | |
| SeasonBackbone Model=Qwen3-VL-32B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 71.6 | |
| SeasonBackbone Model=LLaVA-OV-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 69.2 | |
| ArrowRLBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+ArrowRL, Model Access Level=Open-source2026.04 | 69 | |
| TCDBackbone Model=LLaVA-OV-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 68.5 | |
| Qwen3-VL-4BBackbone Model=Qwen3-VL-4B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 68.4 | |
| SeasonBackbone Model=Qwen3-VL-4B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 67.9 | |
| Qwen3-VL-8BBackbone Model=Qwen3-VL-8B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 66.8 | |
| SeasonBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 66 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 65.8 | |
| TCDBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 64.8 | |
| Structured Reward Reinforcement LearningBackbone Model=LLaVA-OV-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 64.2 | |
| DINO-HEALBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 63.6 | |
| Qwen2.5-VL-7BBackbone Model=Qwen2.5-VL-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 63.3 | |
| LLaVA-OV-7BBackbone Model=LLaVA-OV-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 60.2 | |
| DINO-HEALBackbone Model=LLaVA-OV-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 60.2 |