Multi-modal Understanding and Reasoning on LLaVA-QA90 (test)
6.69AccuracyGACD
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GACDBackbone=mPLUG-Owl22025.09 | 6.69 | 6.28 | |
| GACDBackbone=InstructBLIP2025.09 | 6.28 | 4.77 | |
| GACDBackbone=LLaVA-v1.52025.09 | 6.2 | 5.13 | |
| RLAIF-VBackbone=LLaVA-v1.52025.09 | 5.79 | 4.74 | |
| RLAIF-VBackbone=InstructBLIP2025.09 | 5.27 | 4.62 | |
| RLAIF-VBackbone=mPLUG-Owl22025.09 | 5.03 | 5.33 | |
| AVISCBackbone=LLaVA-v1.52025.09 | 4.88 | 3.87 | |
| AVISCBackbone=mPLUG-Owl22025.09 | 4.75 | 5.12 | |
| M3IDBackbone=InstructBLIP2025.09 | 4.67 | 4.61 | |
| M3IDBackbone=LLaVA-v1.52025.09 | 4.57 | 3.96 | |
| VCDBackbone=mPLUG-Owl22025.09 | 4.52 | 4.64 | |
| M3IDBackbone=mPLUG-Owl22025.09 | 4.44 | 5.18 | |
| AVISCBackbone=InstructBLIP2025.09 | 4.32 | 4.27 | |
| VCDBackbone=InstructBLIP2025.09 | 4.23 | 4.69 | |
| VCDBackbone=LLaVA-v1.52025.09 | 4.15 | 3.85 | |
| baseBackbone=mPLUG-Owl22025.09 | 4.07 | 4.33 | |
| baseBackbone=InstructBLIP2025.09 | 3.84 | 4.07 | |
| baseBackbone=LLaVA-v1.52025.09 | 3.23 | 3.54 |