Visual Question Answering on ST-VQA
84.37AccuracyMaLoRA
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MaLoRAModel=Qwen2.5-VL-7B, Training examples=20.9k2025.10 | 84.37 | — | |
| LoRAModel=Qwen2.5-VL-7B, Training examples=20.9k2025.10 | 84.23 | — | |
| MaLoRAModel=Qwen3-VL-8B, Training examples=20.9k2025.10 | 82.86 | — | |
| LoRAModel=Qwen3-VL-8B, Training examples=20.9k2025.10 | 82.72 | — | |
| BaseModel=Qwen2.5-VL-7B, Training examples=20.9k2025.10 | 82.03 | — | |
| BaseModel=Qwen3-VL-8B, Training examples=20.9k2025.10 | 81.27 | — | |
| QLoRAModel=Qwen2.5-VL-7B, Training examples=20.9k2025.10 | 80.86 | — | |
| CogAgentModel Category=generalist models2023.12 | 80.5 | — | |
| QLoRAModel=Qwen3-VL-8B, Training examples=20.9k2025.10 | 80.19 | — | |
| PALI-X-55BModel Category=task-specific fine-tuning models2023.12 | 79.9 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 69.09 | — | |
| CropVLMReward=LL, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 68.72 | — | |
| CropVLMReward=Accuracy, Backbone=Qwen 2.5 VL, Input Resolution=1792x1792, CropVLM Resolution=2048x20482025.11 | 68.71 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 68.57 | — | |
| CropVLMBase Model=Qwen 2.5 VL 3B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 68.31 | — | |
| MonkeyResolution=896x8962023.11 | 67.7 | — | |
| Qwen 2.5 VLInput Resolution=1792x17922025.11 | 66.67 | — | |
| Qwen 2.5 VL 3BBase Model=Qwen 2.5 VL 3B, Resolution=-, Cropping Strategy=None2025.11 | 65.49 | — | |
| Qwen-VL2023.11 | 59.1 | — | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 56.81 | — | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 55.89 | — | |
| MaLoRAModel=LLaVA-1.5-7B, Training examples=20.9k2025.10 | 55.74 | — | |
| CropVLMBase Model=LLaVA 1.5 7B, Resolution=512, Cropping Strategy=CropVLM2025.11 | 55.21 | — | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=2048, Cropping Strategy=CropVLM2025.11 | 55.15 | — | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=1024, Cropping Strategy=CropVLM2025.11 | 55.02 | — | |
| LoRAModel=LLaVA-1.5-7B, Training examples=20.9k2025.10 | 54.99 | — | |
| QLoRAModel=LLaVA-1.5-7B, Training examples=20.9k2025.10 | 54.59 | — | |
| CropVLMBase Model=GPT 4.1 nano, Resolution=512, Cropping Strategy=CropVLM2025.11 | 53.96 | — | |
| GPT 4.1 nanoBase Model=GPT 4.1 nano, Resolution=-, Cropping Strategy=None2025.11 | 53.28 | — | |
| LLaVA 1.5 7BBase Model=LLaVA 1.5 7B, Resolution=-, Cropping Strategy=None2025.11 | 52.48 | — | |
| BaseModel=LLaVA-1.5-7B, Training examples=20.9k2025.10 | 52.16 | — | |
| LaRAEvaluation Protocol=Zero-shot2024.06 | 47.2 | — | |
| LLaVAROCR Usage=w/ OCR2024.06 | 44.8 | — | |
| LLaVAREvaluation Protocol=Finetuned2024.06 | 40.3 | — | |
| LLaVAREvaluation Protocol=Zero-shot2024.06 | 39.2 | — | |
| LLaVA1.5Evaluation Protocol=Zero-shot2024.06 | 38.1 | — | |
| mPLUG-OwlEvaluation Protocol=Zero-shot2024.06 | 29.3 | — | |
| mPLUG-Owl2Evaluation Protocol=Zero-shot2024.06 | 29.3 | — | |
| LLaVAEvaluation Protocol=Zero-shot2024.06 | 28.9 | — | |
| BLIP-2Evaluation Protocol=Zero-shot2024.06 | 21.7 | — | |
| OpenFlamingoEvaluation Protocol=Zero-shot2024.06 | 19.3 | — | |
| MiniGPT4Evaluation Protocol=Zero-shot2024.06 | 14 | — | |
| PaLI-3OCR pipeline input=true, Resolution=812x8122023.10 | — | 85.7 | |
| PaLI-3OCR pipeline input=false, Resolution=812x8122023.10 | — | 84.1 | |
| PaLI-XOCR pipeline input=true, Resolution=812x8122023.10 | — | 84.5 | |
| PaLI-XOCR pipeline input=false, Resolution=812x8122023.10 | — | 79.9 |