Developmental Vision Evaluation on DevCV Toolbox in-domain (in-domain)
93Overall AccuracyHuman performance
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Human performanceType=Upper bound2025.12 | 93 | 99.1 | 94.5 | 100 | 91.8 | 97.9 | 87.3 | 98.2 | 63.6 | 95.5 | 98.2 | 96.4 | |
| GPT-5Type=Proprietary models2025.12 | 87.6 | 69.1 | 96 | 94.5 | 95 | 99.9 | 85.2 | 95.1 | 62.9 | 90.1 | 88.9 | 86.6 | |
| Gemini-2.5-proType=Proprietary models2025.12 | 82.5 | 77.2 | 68.8 | 90.5 | 93.8 | 97.8 | 88.8 | 86.9 | 54 | 87.7 | 90.6 | 71.7 | |
| GPT-4oType=Proprietary models2025.12 | 74.6 | 39 | 89.8 | 92.6 | 93.7 | 99.7 | 81.7 | 64.2 | 29.3 | 62.9 | 87.9 | 79.3 | |
| Gemini-2.5-flashType=Proprietary models2025.12 | 72.7 | 71.1 | 34.9 | 73.8 | 91.2 | 96.9 | 84.8 | 75.9 | 42.4 | 70.3 | 87.5 | 70.7 | |
| BabyLLaVA-V2-separateType=Baby models (Ours), SFT Strategy=separate2025.12 | 56 | 45.2 | 42.5 | 87.1 | 28.4 | 70.7 | 43.3 | 55.7 | 37 | 49.9 | 98.6 | 56.4 | |
| BabyLLaVA-V2Type=Baby models (Ours), SFT Strategy=mixed2025.12 | 55.2 | 44.6 | 42.3 | 91.3 | 27.4 | 75.3 | 38.8 | 57.6 | 33.1 | 45.6 | 98.4 | 52.8 | |
| Qwen2.5-VL-3BType=Open-source models, Parameters=3B2025.12 | 47 | 29.2 | 33.7 | 40 | 71.7 | 36.5 | 85.8 | 66.7 | 17 | 32.7 | 51.7 | 52.3 | |
| InternVL3.5-1BType=Open-source models, Parameters=1B2025.12 | 37.2 | 27.9 | 32.2 | 34.6 | 34.4 | 25.8 | 44.8 | 64.1 | 11.6 | 36.8 | 47.8 | 49.1 | |
| LLaVA-OneVision-0.5BType=Open-source models, Parameters=0.5B2025.12 | 33.2 | 43.5 | 33.7 | 28.7 | 23.5 | 24 | 12.3 | 58.9 | 7.31 | 49.2 | 37.3 | 46.2 | |
| Random guessType=Lower bound2025.12 | 31.8 | 8.33 | 33.3 | 33.3 | 25 | 25 | 25 | 50 | 12.5 | 37.5 | 50 | 50 |