Action-relation hallucination evaluation on R-Bench Instance
75.86AccuracyRVE
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| RVELVLM Model=ShareGPT4V-7B2026.05 | 75.86 | 86 | |
| RVELVLM Model=LLaVA-1.5-13B2026.05 | 75.73 | 85.6 | |
| RVELVLM Model=LLaVA-1.5-7B2026.05 | 74.46 | 84.97 | |
| RVELVLM Model=LLaVA-NeXT-7B2026.05 | 74.46 | 84.56 | |
| VAFLVLM Model=LLaVA-NeXT-7B2026.05 | 73.22 | 83.35 | |
| VCDLVLM Model=LLaVA-NeXT-7B2026.05 | 72.87 | 83.03 | |
| RVELVLM Model=InstructBLIP-7B2026.05 | 70.64 | 81.2 | |
| VAFLVLM Model=LLaVA-1.5-13B2026.05 | 70.45 | 80.67 | |
| VCDLVLM Model=LLaVA-1.5-13B2026.05 | 70.05 | 80.43 | |
| VCDLVLM Model=ShareGPT4V-7B2026.05 | 69.77 | 79.77 | |
| VanillaLVLM Model=LLaVA-1.5-13B2026.05 | 69.12 | 79.37 | |
| ICDLVLM Model=LLaVA-1.5-13B2026.05 | 69.01 | 79.3 | |
| VAFLVLM Model=ShareGPT4V-7B2026.05 | 68.95 | 79.1 | |
| VCDLVLM Model=LLaVA-1.5-7B2026.05 | 68.65 | 79.76 | |
| ICDLVLM Model=InstructBLIP-7B2026.05 | 68.53 | 79.33 | |
| ICDLVLM Model=LLaVA-NeXT-7B2026.05 | 68.5 | 78.8 | |
| VAFLVLM Model=InstructBLIP-7B2026.05 | 68.05 | 79 | |
| VAFLVLM Model=LLaVA-1.5-7B2026.05 | 67.69 | 77.61 | |
| VCDLVLM Model=InstructBLIP-7B2026.05 | 67.3 | 78.15 | |
| VanillaLVLM Model=InstructBLIP-7B2026.05 | 66.7 | 77.57 | |
| VanillaLVLM Model=ShareGPT4V-7B2026.05 | 66.37 | 76.54 | |
| ICDLVLM Model=ShareGPT4V-7B2026.05 | 66.25 | 76.4 | |
| VanillaLVLM Model=LLaVA-NeXT-7B2026.05 | 64.59 | 83.15 | |
| VanillaLVLM Model=LLaVA-1.5-7B2026.05 | 62.94 | 73.45 | |
| ICDLVLM Model=LLaVA-1.5-7B2026.05 | 59.22 | 69.83 |