Hallucination-oriented Video Understanding on VidHallucer (test)
62.5AccuracyStructured Reward Reinforcement Learning
Evaluation Results
| Method | Links | |
|---|---|---|
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-32B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 62.5 | |
| Qwen3-VL-32BBackbone Model=Qwen3-VL-32B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 62 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-8B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 56.8 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen3-VL-4B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 55.8 | |
| Qwen3-VL-8BBackbone Model=Qwen3-VL-8B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 55.7 | |
| SeasonBackbone Model=Qwen3-VL-32B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 55.1 | |
| SeasonBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 54.8 | |
| Structured Reward Reinforcement LearningBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 54.8 | |
| ArrowRLBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+ArrowRL, Model Access Level=Open-source2026.04 | 54.5 | |
| SeasonBackbone Model=Qwen3-VL-4B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 54.2 | |
| GPT-4oBackbone Model=GPT-4o, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 53.3 | |
| DINO-HEALBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 53.3 | |
| SeasonBackbone Model=Qwen3-VL-8B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 53.3 | |
| Qwen2.5-VL-7BBackbone Model=Qwen2.5-VL-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 53.1 | |
| TCDBackbone Model=Qwen2.5-VL-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 52.8 | |
| Qwen3-VL-4BBackbone Model=Qwen3-VL-4B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 51.4 | |
| SeasonBackbone Model=LLaVA-OV-7B, Method/Configuration=+Season, Model Access Level=Open-source2026.04 | 49.3 | |
| Structured Reward Reinforcement LearningBackbone Model=LLaVA-OV-7B, Method/Configuration=+Ours, Model Access Level=Open-source2026.04 | 48.5 | |
| TCDBackbone Model=LLaVA-OV-7B, Method/Configuration=+TCD, Model Access Level=Open-source2026.04 | 48.1 | |
| DINO-HEALBackbone Model=LLaVA-OV-7B, Method/Configuration=+DINO-HEAL, Model Access Level=Open-source2026.04 | 46.9 | |
| LLaVA-OV-7BBackbone Model=LLaVA-OV-7B, Method/Configuration=Base, Model Access Level=Open-source2026.04 | 46.4 | |
| Gemini 1.5 ProBackbone Model=Gemini 1.5 Pro, Method/Configuration=Base, Model Access Level=Closed-source2026.04 | 37.8 |