Discriminative Hallucination Evaluation on AMBER Discriminative
90.3F1 ScoreQwen2.5-VL 3B + NoisyGRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| Qwen2.5-VL 3B + NoisyGRPOModel=Qwen2.5-VL 3B, Training Strategy=+ NoisyGRPO2025.10 | 90.3 | |
| Qwen2.5-VL 3BModel=Qwen2.5-VL 3B, Training Strategy=Base2025.10 | 89.6 | |
| Qwen2.5-VL 3B + GRPOModel=Qwen2.5-VL 3B, Training Strategy=+ GRPO2025.10 | 89.2 | |
| Qwen2.5-VL 3B + SFTModel=Qwen2.5-VL 3B, Training Strategy=+ SFT2025.10 | 88.8 | |
| Qwen2.5-VL 7B + NoisyGRPOModel=Qwen2.5-VL 7B, Training Strategy=+ NoisyGRPO2025.10 | 88.2 | |
| Qwen2.5-VL 7B + GRPOModel=Qwen2.5-VL 7B, Training Strategy=+ GRPO2025.10 | 88 | |
| Qwen2.5-VL 7B + SFTModel=Qwen2.5-VL 7B, Training Strategy=+ SFT2025.10 | 87.5 | |
| Qwen2.5-VL 7BModel=Qwen2.5-VL 7B, Training Strategy=Base2025.10 | 87.4 | |
| LLaVA-1.5 7BModel=LLaVA-1.5 7B2025.10 | 74.7 |