Agentic Reasoning on WebShop
74.1Success RateC-RF w/ NTF
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| C-RF w/ NTFModel=Qwen2.5-7B-Instruct, Type=RL Training2026.06 | 74.1 | 80.2 | |
| PPO (with critic)Model=Qwen2.5-7B-Instruct, Type=RL Training2026.06 | 68.7 | 81.4 | |
| GRPOModel=Qwen2.5-7B-Instruct, Type=RL Training2026.06 | 66.1 | 79.3 | |
| C-RF w/ NTFModel=Qwen2.5-1.5B-Instruct, Type=RL Training2026.06 | 65.7 | 72.4 | |
| RLOOModel=Qwen2.5-7B-Instruct, Type=RL Training2026.06 | 65.7 | 80.3 | |
| EAPO-8BModel Category=Ours2026.05 | 65.58 | — | |
| EAPO-8B2026.05 | 65.58 | — | |
| EAPO-4BModel Category=Ours2026.05 | 60.84 | — | |
| EAPO-4B2026.05 | 60.84 | — | |
| GRPOModel=Qwen2.5-1.5B-Instruct, Type=RL Training2026.06 | 56.8 | 75.8 | |
| EAPO-1.7B/2BModel Category=Ours2026.05 | 53.28 | — | |
| EAPO-1.7B/2B2026.05 | 53.28 | — | |
| RLOOModel=Qwen2.5-1.5B-Instruct, Type=RL Training2026.06 | 52.1 | 73.9 | |
| PPO (with critic)Model=Qwen2.5-1.5B-Instruct, Type=RL Training2026.06 | 51.5 | 73.8 | |
| Claude-4-Sonnet-0929Model Category=Closed-source Models2026.05 | 50.97 | — | |
| Claude-4-Sonnet-0929Category=Closed-source2026.05 | 50.97 | — | |
| DeepMiner-Mano-72BModel Category=Closed-source Models2026.05 | 49.71 | — | |
| DeepMiner-Mano-72BCategory=Closed-source2026.05 | 49.71 | — | |
| LAMERCategory=Training Method2026.05 | 47.74 | — | |
| UI-TARS-2-2509Model Category=Closed-source Models2026.05 | 46.85 | — | |
| UI-TARS-2-2509Category=Closed-source2026.05 | 46.85 | — | |
| Qwen3-VL-235B-A22BModel Category=Open-source Models2026.05 | 45.05 | — | |
| Qwen3-VL-235B-A22BCategory=Open-source2026.05 | 45.05 | — | |
| Qwen3-VL-32BModel Category=Open-source Models2026.05 | 44.29 | — | |
| Claude-3.7-SonnetModel Category=Closed-source Models2026.05 | 44.11 | — | |
| Seed1.5-VL-250717Model Category=Closed-source Models2026.05 | 43.09 | — | |
| Seed1.5-VL-250717Category=Closed-source2026.05 | 43.09 | — | |
| GiGPOCategory=Training Method2026.05 | 42.24 | — | |
| DeepMiner-Mano-7BModel Category=Closed-source Models2026.05 | 41.94 | — | |
| DAPOCategory=Training Method2026.05 | 40.9 | — | |
| DART-GUI-7BModel Category=Open-source Models2026.05 | 40.83 | — | |
| DART-GUI-7BCategory=Open-source2026.05 | 40.83 | — | |
| OpenAI CUAModel Category=Closed-source Models2026.05 | 40.29 | — | |
| UI-TARS-72B-dpoModel Category=Open-source Models2026.05 | 39.61 | — | |
| OpenAI CUA o3Model Category=Closed-source Models2026.05 | 38.73 | — | |
| OpenAI CUA o3Category=Closed-source2026.05 | 38.73 | — | |
| GRPOCategory=Training Method2026.05 | 38.57 | — | |
| OpenCUA-32BModel Category=Open-source Models2026.05 | 35.48 | — | |
| OpenCUA-32BCategory=Open-source2026.05 | 35.48 | — | |
| GUI-Owl-7BModel Category=Open-source Models2026.05 | 34.06 | — | |
| GUI-Owl-7BCategory=Open-source2026.05 | 34.06 | — | |
| HTPOBase Model=Qwen3-8B2026.05 | 33.8 | 58.7 | |
| ARPOModel Category=Open-source Models2026.05 | 33.17 | — | |
| ARPOCategory=Open-source2026.05 | 33.17 | — | |
| TianXi-Action-7BModel Category=Closed-source Models2026.05 | 32.46 | — | |
| TianXi-Action-7BCategory=Closed-source2026.05 | 32.46 | — | |
| DAPOBase Model=Qwen3-8B2026.05 | 31.8 | 57.3 | |
| GRPOBase Model=Qwen3-8B2026.05 | 31.4 | 55.4 | |
| ZeroGUIModel Category=Open-source Models2026.05 | 31.29 | — | |
| ZeroGUICategory=Open-source2026.05 | 31.29 | — | |
| OpenCUA-7BModel Category=Open-source Models2026.05 | 30.7 | — | |
| ReflexionModel=Qwen2.5-7B-Instruct, Type=Prompting2026.06 | 28.8 | 58.1 | |
| UI-TARS-7BModel Category=Open-source Models2026.05 | 28.55 | — | |
| UI-TARS-7BCategory=Open-source2026.05 | 28.55 | — | |
| ReflexionModel=Qwen2.5-1.5B-Instruct, Type=Prompting2026.06 | 21.9 | 55.8 | |
| ReActModel=Qwen2.5-7B-Instruct, Type=Prompting2026.06 | 19.5 | 46.2 | |
| ReActModel=Qwen2.5-1.5B-Instruct, Type=Prompting2026.06 | 11.3 | 40.1 | |
| Qwen2.5Model=Qwen2.5-7B-Instruct, Type=Prompting2026.06 | 7.8 | 26.4 | |
| Qwen2.5Model=Qwen2.5-1.5B-Instruct, Type=Prompting2026.06 | 5.2 | 23.1 |