GUI Agent Success on WebVoyager, Online-Mind2Web, and DeepShop (test average)
69.3Average Success RateGemini computer-use-preview
Evaluation Results
| Method | Links | |
|---|---|---|
| Gemini computer-use-preview# Steps=1002026.05 | 69.3 | |
| Orchard-GUI-4B (SFT + RL)# Steps=30, # Tasks=2.6k2026.05 | 68.4 | |
| GPT-5 (SoM)# Steps=1002026.05 | 65.8 | |
| Gemini-3-flash (Axtree)# Steps=1002026.05 | 61.9 | |
| o3 (SoM)# Steps=1002026.05 | 61.5 | |
| Qwen3-VL-235B-A22B-Thinking# Steps=302026.05 | 61.2 | |
| Orchard-GUI-4B-SFT# Steps=30, # Tasks=0.4k2026.05 | 52 | |
| MolmoWeb-8B# Steps=100, # Tasks=>278.5K2026.05 | 51.9 | |
| Gemini-3-flash (Axtree)# Steps=302026.05 | 51.4 | |
| OpenAI computer-use-preview# Steps=1002026.05 | 51.3 | |
| GPT-5 (Axtree)# Steps=302026.05 | 51.1 | |
| MolmoWeb-4B# Steps=100, # Tasks=>278.5k2026.05 | 47.4 | |
| Fara-7B# Steps=100, # Tasks=>123.2k2026.05 | 44.6 | |
| GLM-4.1V-9B-Thinking# Steps=1002026.05 | 44.2 | |
| GPT-4o (SoM)# Steps=1002026.05 | 38.6 | |
| Qwen3-VL-4B-Thinking# Steps=302026.05 | 38.1 | |
| UI-TARS-1.5-7B# Steps=1002026.05 | 36.4 |