Offline GUI Agent Evaluation on AndroidControl High
83.7Type AccuracyUI-TARS-7B
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| UI-TARS-7BModel Category=Open-source Models2026.05 | 83.7 | 72.5 | |
| Mimo-VL-7B + WildGUIPre-training=WildGUI2026.05 | 80.6 | 71.4 | |
| Mimo-VL-7BModel Category=Open-source Models2026.05 | 76.3 | 65.6 | |
| Qwen2.5-VL-7B*Model Category=Open-source Models2026.05 | 75.1 | 62.9 | |
| Qwen2.5-VL-7B* + WildGUIPre-training=WildGUI2026.05 | 74.6 | 64.5 | |
| OS-Atlas-7BModel Category=Open-source Models2026.05 | 70.4 | 56.5 | |
| GPT-4oModel Category=Closed-source Models2026.05 | 66.3 | 20.8 | |
| OS-Genesis-7BModel Category=Open-source Models2026.05 | 65.9 | 44.4 | |
| Aguvis-7BModel Category=Open-source Models2026.05 | 65.6 | 54.2 |