Offline GUI Agent Evaluation on AndroidControl Low
98Action Type AccuracyUI-TARS-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UI-TARS-7BModel Category=Open-source Models2026.05 | 98 | 90.8 | |
| Mimo-VL-7B + WildGUIPre-training=WildGUI2026.05 | 95.5 | 91.8 | |
| Qwen2.5-VL-7B* + WildGUIPre-training=WildGUI2026.05 | 94.9 | 90.3 | |
| Qwen2.5-VL-7B*Model Category=Open-source Models2026.05 | 94.1 | 85 | |
| Aguvis-7BModel Category=Open-source Models2026.05 | 93.9 | 89.4 | |
| Mimo-VL-7BModel Category=Open-source Models2026.05 | 92.9 | 87.9 | |
| OS-Genesis-7BModel Category=Open-source Models2026.05 | 90.7 | 74.2 | |
| GPT-4oModel Category=Closed-source Models2026.05 | 74.3 | 19.4 | |
| OS-Atlas-7BModel Category=Open-source Models2026.05 | 73 | 67.3 |