Web Navigation on WebVoyager
93.4Success RateFaraGen1.5 Solver (GPT-5.4)
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| FaraGen1.5 Solver (GPT-5.4)Size=—2026.06 | 93.4 | — | |
| GPT-5 (SoM)# Steps=100, # Tasks=–2026.06 | 90.6 | — | |
| GPT-5 SoMSize=—2026.06 | 90.6 | — | |
| Fara1.5-27BSize=27B2026.06 | 89.3 | — | |
| Best-of-QVLM Agent Backbone=GPT-4.1, Model Category=Proprietary Models2026.01 | 88.8 | 7.1 | |
| Gemini computer-use-preview# Steps=100, # Tasks=–2026.06 | 88.6 | — | |
| OpenAI Operator†Size=—2026.06 | 87 | — | |
| Fara1.5-9BSize=9B2026.06 | 86.6 | — | |
| Gemini-3-flash (Axtree)# Steps=100, # Tasks=–2026.06 | 85.6 | — | |
| Holo2†Size=30B-A3B2026.06 | 83 | — | |
| PromptingVLM Agent Backbone=GPT-4.1, Model Category=Proprietary Models2026.01 | 82.4 | 7 | |
| GUI-Owl-1.5†Size=32B2026.06 | 82 | — | |
| Fara1.5-4BSize=4B2026.06 | 80.8 | — | |
| Holo2†Size=8B2026.06 | 80.2 | — | |
| o3 (SoM)# Steps=100, # Tasks=–2026.06 | 79.3 | — | |
| o3 SoMSize=—2026.06 | 79.3 | — | |
| MolmoWeb-8B# Steps=100, # Tasks=>278.5k2026.06 | 78.2 | — | |
| MolmoWeb†Size=8B2026.06 | 78.2 | — | |
| GUI-Owl-1.5†Size=8B2026.06 | 78.1 | — | |
| Best-of-QVLM Agent Backbone=Qwen2.5-VL-72B, Model Category=Open-Source Models2026.01 | 76.6 | 8.8 | |
| MolmoWeb-4B# Steps=100, # Tasks=>278.5k2026.06 | 75.2 | — | |
| Gemini-3-flash (Axtree)# Steps=30, # Tasks=–2026.06 | 74.4 | — | |
| OpenWebRL-4Bbackbone=4B, # Steps=30, # Tasks=2.2k2026.06 | 74.1 | — | |
| OpenWebRL-8Bbackbone=8B, # Steps=30, # Tasks=2.2k2026.06 | 73.8 | — | |
| Fara-7B# Steps=100, # Tasks=>123.2k2026.06 | 73.5 | — | |
| Fara-7BSize=7B2026.06 | 73.5 | — | |
| Random ActionVLM Agent Backbone=GPT-4.1, Model Category=Proprietary Models2026.01 | 72.1 | 11.3 | |
| OpenAI computer-use-preview# Steps=100, # Tasks=–2026.06 | 70.9 | — | |
| GPT-5 (Axtree)# Steps=30, # Tasks=–2026.06 | 70.6 | — | |
| PromptingVLM Agent Backbone=Qwen2.5-VL-72B, Model Category=Open-Source Models2026.01 | 69.1 | 9.4 | |
| OpenWebRL-4B w/ OpenWebRL-Judge-8Bbackbone=4B, # Steps=30, # Tasks=2.2k2026.06 | 68.9 | — | |
| GLM-4.1V-9B-Thinking# Steps=100, # Tasks=–2026.06 | 66.8 | — | |
| UI-TARS-1.5-7B# Steps=100, # Tasks=–2026.06 | 66.4 | — | |
| Qwen3-VL-235B-A22B-Thinking# Steps=30, # Tasks=–2026.06 | 66.4 | — | |
| OpenWebRL-8B-SFTbackbone=8B, # Steps=30, # Tasks=0.9k2026.06 | 66.2 | — | |
| GPT-4o (SoM)# Steps=100, # Tasks=–2026.06 | 65.1 | — | |
| MANGOBackbone LLM=GPT-5 mini2026.04 | 63.57 | — | |
| Qwen3-VL-8B-Thinking# Steps=30, # Tasks=–2026.06 | 61.3 | — | |
| OpenWebRL-4B-SFTbackbone=4B, # Steps=30, # Tasks=0.4k2026.06 | 60.2 | — | |
| Random ActionVLM Agent Backbone=Qwen2.5-VL-72B, Model Category=Open-Source Models2026.01 | 58.3 | 12 | |
| AgentOccamBackbone LLM=GPT-5 mini2026.04 | 56.25 | — | |
| Best-of-QVLM Agent Backbone=Qwen2.5-VL-7B, Model Category=Open-Source Models2026.01 | 55.7 | 10.3 | |
| Holo1-7B# Steps=30, # Tasks=>15.6k2026.06 | 55.4 | — | |
| WebSTAR-32BTraining Paradigm=External expert / closed data, Ext. Expert Steps=100K2026.05 | 53.5 | — | |
| Qwen3-VL-4B-Thinking# Steps=30, # Tasks=–2026.06 | 52.6 | — | |
| WebSTAR-7BTraining Paradigm=External expert / closed data, Ext. Expert Steps=100K2026.05 | 47 | — | |
| PRO-CUA-8Training Paradigm=Self-evolving 8B, Ext. Expert Steps=02026.05 | 43.2 | — | |
| PRO-CUATraining Paradigm=Self-evolving 4B, Ext. Expert Steps=02026.05 | 42.4 | — | |
| Random ActionVLM Agent Backbone=Qwen2.5-VL-7B, Model Category=Open-Source Models2026.01 | 40.3 | 11.9 | |
| PromptingVLM Agent Backbone=Qwen2.5-VL-7B, Model Category=Open-Source Models2026.01 | 38.8 | 10.9 | |
| MANGOBackbone LLM=Qwen3 32B2026.04 | 37.98 | — | |
| Rule-based Step-RLTraining Paradigm=Self-evolving 4B, Ext. Expert Steps=02026.05 | 34.7 | — | |
| AgentOccamBackbone LLM=Qwen3 32B2026.04 | 34.11 | — | |
| Rule-based Step-RLTraining Paradigm=Self-evolving 8B, Ext. Expert Steps=02026.05 | 33.8 | — | |
| FBCTraining Paradigm=Self-evolving 8B, Ext. Expert Steps=02026.05 | 31.8 | — | |
| UI-TARS-1.5-7BTraining Paradigm=External expert / closed data, Ext. Expert Steps=Closed data2026.05 | 30.3 | — | |
| MANGOBackbone LLM=Qwen3 14B2026.04 | 30.23 | — | |
| FBCTraining Paradigm=Self-evolving 4B, Ext. Expert Steps=02026.05 | 29.7 | — | |
| Qwen3-VL-4B-InstructTraining Paradigm=Self-evolving 4B, Ext. Expert Steps=02026.05 | 27.5 | — | |
| MANGOBackbone LLM=Qwen3 8B2026.04 | 27.13 | — | |
| Qwen3-VL-8B-InstructTraining Paradigm=Self-evolving 8B, Ext. Expert Steps=02026.05 | 25.6 | — | |
| AgentOccamBackbone LLM=Qwen3 14B2026.04 | 25.58 | — | |
| MANGOBackbone LLM=Qwen3 4B2026.04 | 25.58 | — | |
| AgentOccamBackbone LLM=Qwen3 4B2026.04 | 22.48 | — | |
| AgentOccamBackbone LLM=Qwen3 8B2026.04 | 20.93 | — | |
| WebWalkerBackbone LLM=GPT-5 mini2026.04 | 16.28 | — | |
| WebWalkerBackbone LLM=Qwen3 4B2026.04 | 14.73 | — | |
| WebWalkerBackbone LLM=Qwen3 32B2026.04 | 14.73 | — | |
| WebWalkerBackbone LLM=Qwen3 8B2026.04 | 12.4 | — | |
| WebWalkerBackbone LLM=Qwen3 14B2026.04 | 12.4 | — | |
| GPT-4oModel=GPT-4o, Strategy=Zero-Shot2026.05 | 9.6 | 14.7 | |
| SCALEModel=Qwen2.5-VL-7B, Strategy=SCALE(ours)2026.05 | 7.9 | 15 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B, Strategy=OS-Genesis2026.05 | 6.7 | 15 | |
| SCALEModel=InternVL2.5-8B, Strategy=SCALE(ours)2026.05 | 1.8 | 14.9 | |
| ViGoRLModel=ViGoRL, Strategy=Zero-Shot2026.05 | 0.6 | 14.9 | |
| Qwen2.5-VL-7BModel=Qwen2.5-VL-7B, Strategy=Zero-Shot2026.05 | 0.6 | 15 | |
| AugvisModel=Augvis, Strategy=Zero-Shot2026.05 | 0 | — | |
| InternVL2.5-8BModel=InternVL2.5-8B, Strategy=Zero-Shot2026.05 | 0 | — | |
| InternVL2.5-8BModel=InternVL2.5-8B, Strategy=OS-Genesis2026.05 | 0 | — | |
| LLaVA-NeXT-8BModel=LLaVA-NeXT-8B, Strategy=Zero-Shot2026.05 | 0 | — | |
| SCALE-20kModel=LLaVA-NeXT-8B, Strategy=SCALE-20k2026.05 | 0 | — |