Visual Question Answering on MathVista mini
63.8AccuracyGPT-4o
Evaluation Results
| Method | Links | |
|---|---|---|
| GPT-4oInference mode=Zero-shot2024.10 | 63.8 | |
| Qwen2 VLInference mode=Zero-shot, Parameters=7B2024.10 | 58.2 | |
| MiniCPM-Llama3-V 2.5Inference mode=Zero-shot, Parameters=8B2024.10 | 54.3 | |
| GPT-4o-miniInference mode=Zero-shot2024.10 | 52.4 | |
| Baichuan-omniInference mode=Zero-shot, Parameters=7B2024.10 | 51.9 | |
| VITAInference mode=Zero-shot, Parameters=8x7B2024.10 | 44.9 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=+DIPE2026.03 | 33.2 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=Base2026.03 | 32.7 | |
| MRoPE-IPositional Encoding Method=MRoPE-I, DIPE Enhancement=+DIPE2026.03 | 32.4 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=+DIPE2026.03 | 32.2 | |
| MRoPEPositional Encoding Method=MRoPE, DIPE Enhancement=Base2026.03 | 31.7 | |
| Vanilla RoPEPositional Encoding Method=Vanilla RoPE, DIPE Enhancement=Base2026.03 | 30.9 | |
| InstructBLIPParameters=7B2024.03 | 25.3 | |
| LumenParameters=7B2024.03 | 24.6 | |
| LLaVA-v1.5Parameters=7B2024.03 | 23.5 | |
| MiniGPT-4Parameters=7B2024.03 | 23.1 |