Vision-Language Task Evaluation on DevCV Toolbox Ego4D out-of-domain
93.5Overall AccuracyHuman performance
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Human performanceModel Family=Upper Bound2025.12 | 93.5 | 96.4 | 98.2 | 96.4 | 96.4 | 98.8 | 90.9 | 100 | 58.2 | 100 | 100 | 92.7 | |
| Gemini-2.5-proModel Family=Proprietary models2025.12 | 88.2 | 81.9 | 88 | 94.8 | 91.9 | 100 | 90.2 | 91.3 | 50.3 | 87.9 | 96.5 | 97.8 | |
| GPT-5Model Family=Proprietary models2025.12 | 86.7 | 77.5 | 88 | 96.8 | 91.9 | 100 | 88.7 | 94.4 | 50.3 | 82.6 | 94.6 | 88.5 | |
| Gemini-2.5-flashModel Family=Proprietary models2025.12 | 77.7 | 72.9 | 49.6 | 86.7 | 92.5 | 99.2 | 88.4 | 80.6 | 37.1 | 70.2 | 97.8 | 80.1 | |
| GPT-4oModel Family=Proprietary models2025.12 | 67.6 | 62.1 | 45.1 | 94.7 | 85.3 | 100 | 80.4 | 45.5 | 13.2 | 48.3 | 84.3 | 84.6 | |
| Qwen2.5-VL-3BModel Family=Open-source models2025.12 | 48.1 | 35.7 | 32.6 | 44.1 | 41.9 | 25.7 | 86.7 | 79.8 | 28.9 | 51.1 | 50.2 | 53.4 | |
| InternVL3.5-1BModel Family=Open-source models2025.12 | 43.7 | 34.7 | 34 | 34.1 | 33.8 | 24.9 | 60.7 | 73.9 | 16.9 | 68.5 | 49 | 49.9 | |
| BabyLLaVA-V2Model Family=Baby models2025.12 | 41.1 | 33.9 | 32.9 | 42.4 | 29.8 | 40.7 | 30 | 55.3 | 17.7 | 37.1 | 86 | 45.8 | |
| LLaVA-OneVision-0.5BModel Family=Open-source models2025.12 | 39.4 | 43.9 | 32.6 | 33.3 | 27.7 | 22.6 | 21.6 | 73 | 15.2 | 67.7 | 46.8 | 49.4 | |
| Random guessModel Family=Lower Bound2025.12 | 31.8 | 8.33 | 33.3 | 33.3 | 25 | 25 | 25 | 50 | 12.5 | 37.5 | 50 | 50 |