Vision-Language Reasoning on DisasterBench (val)
87.7Overall AccuracyGemini-2.5-pro
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Gemini-2.5-proModel Source Type=Closed-Source Models2026.06 | 87.7 | 1,323 | |
| Claude-Sonnet-4-5Model Source Type=Closed-Source Models2026.06 | 86.26 | 457 | |
| GPT-5Model Source Type=Closed-Source Models2026.06 | 83.69 | 644 | |
| Gemini-2.5-flashModel Source Type=Closed-Source Models2026.06 | 82.96 | 1,321 | |
| Gemini-2.0-flashModel Source Type=Closed-Source Models2026.06 | 81.68 | 435 | |
| DisasterVLModel Source Type=Open-Source Models, Scale=2B2026.06 | 81.57 | 168 | |
| Grok-4Model Source Type=Closed-Source Models2026.06 | 77.87 | 733 | |
| Qwen2.5-VL-7BModel Source Type=Open-Source Models2026.06 | 74.94 | 425 | |
| GPT-4oModel Source Type=Closed-Source Models2026.06 | 73.19 | 335 | |
| InternVL-3-5-4BModel Source Type=Open-Source Models2026.06 | 72.41 | 459 | |
| InternVL-3-5-8BModel Source Type=Open-Source Models2026.06 | 72.31 | 322 | |
| InternVL2-8BModel Source Type=Open-Source Models2026.06 | 71.38 | 255 | |
| Deepseek-VL2-SModel Source Type=Open-Source Models2026.06 | 70.97 | 359 | |
| GPT-4o miniModel Source Type=Closed-Source Models2026.06 | 67.27 | 423 | |
| Phi-3-Vision(4.15B)Model Source Type=Open-Source Models2026.06 | 66.8 | 272 | |
| InternVL-3-5-2BModel Source Type=Open-Source Models2026.06 | 66.13 | 355 | |
| Qwen2.5-VL-3BModel Source Type=Open-Source Models2026.06 | 65.31 | 428 | |
| InternVL-3-5-1BModel Source Type=Open-Source Models2026.06 | 55.79 | 380 | |
| Janus-Pro-1BModel Source Type=Open-Source Models2026.06 | 55.12 | 354 | |
| InternVL2-2BModel Source Type=Open-Source Models2026.06 | 54.09 | 425 | |
| Deepseek-VL2-TModel Source Type=Open-Source Models2026.06 | 52.91 | 190 | |
| Qwen2-VL-2BModel Source Type=Open-Source Models2026.06 | 49.92 | 352 |