Multimodal Understanding on HallusionBench
77.2AccuracyPRISM + GRPO
Evaluation Results
| Method | Links | |
|---|---|---|
| PRISM + GRPOBase Model=Qwen3-VL-8B2026.04 | 77.2 | |
| PRISM + DAPOBase Model=Qwen3-VL-8B2026.04 | 76.1 | |
| PRISM + GSPOBase Model=Qwen3-VL-8B2026.04 | 75.8 | |
| PRISM + GRPOBase Model=Qwen3-VL-4B2026.04 | 74.8 | |
| + GSPOBase Model=Qwen3-VL-8B2026.04 | 73.6 | |
| PRISM + DAPOBase Model=Qwen3-VL-4B2026.04 | 72.9 | |
| PRISM + GSPOBase Model=Qwen3-VL-4B2026.04 | 72.9 | |
| PRISMBase Model=Qwen3-VL-4B2026.04 | 72.6 | |
| + DAPOBase Model=Qwen3-VL-4B2026.04 | 72.3 | |
| + GRPOBase Model=Qwen3-VL-4B2026.04 | 72 | |
| + GSPOBase Model=Qwen3-VL-4B2026.04 | 71.9 | |
| + GRPOBase Model=Qwen3-VL-8B2026.04 | 71.9 | |
| InstructBase Model=Qwen3-VL-8B2026.04 | 71.6 | |
| + DAPOBase Model=Qwen3-VL-8B2026.04 | 71.5 | |
| + SFTBase Model=Qwen3-VL-8B2026.04 | 71.2 | |
| OmniInference scheme=no-thinking2026.04 | 70.1 | |
| PRISMBase Model=Qwen3-VL-8B2026.04 | 69.5 | |
| + SFTBase Model=Qwen3-VL-4B2026.04 | 69.1 | |
| InstructBase Model=Qwen3-VL-4B2026.04 | 68.2 | |
| Qwen3-VL-32BToken Ratio=100%2026.05 | 63.76 | |
| F3AToken Ratio=60%2026.05 | 62.5 | |
| CDPrunerToken Ratio=60%2026.05 | 61.77 | |
| Qwen3-VL-30B-A3B-InstructInference scheme=no-thinking2026.04 | 61.5 | |
| F3AToken Ratio=40%2026.05 | 61.03 | |
| FastVToken Ratio=60%2026.05 | 59.87 | |
| VisionZipToken Ratio=60%2026.05 | 59.87 | |
| CDPrunerToken Ratio=40%2026.05 | 59.66 | |
| DivPruneToken Ratio=60%2026.05 | 59.35 | |
| FastVToken Ratio=40%2026.05 | 57.66 | |
| F3AToken Ratio=20%2026.05 | 56.61 | |
| VisionZipToken Ratio=40%2026.05 | 56.3 | |
| DivPruneToken Ratio=40%2026.05 | 55.88 | |
| FastVToken Ratio=20%2026.05 | 55.77 | |
| VisionZipToken Ratio=20%2026.05 | 54.62 | |
| InternVL3.5-30B-A3BInference scheme=no-thinking2026.04 | 53.8 | |
| CDPrunerToken Ratio=20%2026.05 | 51.25 | |
| DivPruneToken Ratio=20%2026.05 | 51.15 |