Visual Understanding on JARVIS-VLA Benchmark 1.0 (test)
76.7AccuracyGPT-4o
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4o2025.03 | 76.7 | 1 | |
| JARVIS-VLA-Qwen2-VLModel Size=7B2025.03 | 76.7 | 1 | |
| Qwen2-VL (Vision)Model Size=7B2025.03 | 65.1 | 3 | |
| GPT-4o-mini2025.03 | 62.8 | 4 | |
| Molmo-d-0924Model Size=7B2025.03 | 58.1 | 5 | |
| Qwen2-VL (Grounding)Model Size=7B2025.03 | 51.2 | 6 | |
| Qwen2-VLModel Size=7B2025.03 | 46.5 | 7 | |
| Qwen2-VL (Knowledge)Model Size=7B2025.03 | 46.5 | 7 | |
| Llama-3.2Model Size=11B2025.03 | 44.2 | 9 | |
| Llava-NextModel Size=8B2025.03 | 41.9 | 10 |