Interactive web-based shopping tasks on WebShop
80.5Success RateGRPO w/ SG & GR
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GRPO w/ SG & GRBackbone=Qwen2.5-7B-Instruct, Setting=RL Training2026.04 | 80.5 | 90.1 | |
| GRPO w/ SG & GRBackbone=Qwen3-4B, Setting=RL Training2026.04 | 78.1 | 87.8 | |
| GRPO w/ SGBackbone=Qwen3-4B, Setting=RL Training2026.04 | 77.3 | 87 | |
| GRPO w/ SGBackbone=Qwen2.5-7B-Instruct, Setting=RL Training2026.04 | 76.6 | 89.3 | |
| SLEA-RLBase Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 76.3 | 87.6 | |
| SLEA-RLBase Model=Qwen2.5-1.5B-Instruct2026.03 | 75.4 | 88.7 | |
| GiGPO*Base Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 72.8 | 84.4 | |
| SKILLRLCategory=Memory-Augmented RL-based Methods, Backbone=Qwen2.5-7B-Instruct2026.02 | 72.7 | 85.2 | |
| SkillRLBase Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 72.7 | 85.2 | |
| GRPOBackbone=Qwen3-4B, Setting=RL Training2026.04 | 71.9 | 84.3 | |
| GRPOCategory=RL-based Methods, Replicated=true2026.02 | 66.1 | 79.3 | |
| GRPO*Base Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 66.1 | 79.3 | |
| RLOOCategory=RL-based Methods, Replicated=true2026.02 | 65.7 | 80.3 | |
| RLOO*Base Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 65.7 | 80.3 | |
| GRPOBackbone=Qwen2.5-7B-Instruct, Setting=RL Training2026.04 | 65.6 | 77.5 | |
| GiGPO*Base Model=Qwen2.5-1.5B-Instruct2026.03 | 65 | 83.1 | |
| GRPO*Base Model=Qwen2.5-1.5B-Instruct2026.03 | 56.8 | 75.8 | |
| GRPO w/ SG & GRBackbone=Qwen3-1.7B, Setting=RL Training2026.04 | 56.3 | 79.4 | |
| Pass@N (oracle)Training=false, Backbone=Gemma4-4B2026.06 | 53 | — | |
| GRPO w/ SGBackbone=Qwen3-1.7B, Setting=RL Training2026.04 | 49.2 | 76.7 | |
| Pass@N (oracle)Training=false, Backbone=Qwen3.5-9B2026.06 | 49 | — | |
| SimpleMem+GRPOCategory=Memory-Augmented RL-based Methods2026.02 | 46.9 | 67.8 | |
| SimpleMem+GRPOBase Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 46.9 | 67.8 | |
| Progress AdvantageTraining=false, Backbone=Gemma4-4B2026.06 | 45 | — | |
| ThinkPRM-14BTraining=true, Backbone=Gemma4-4B2026.06 | 43 | — | |
| Progress AdvantageTraining=false, Backbone=Qwen3.5-9B2026.06 | 42 | — | |
| Mean-of-NTraining=false, Backbone=Gemma4-4B2026.06 | 41.6 | — | |
| WildReward-8BTraining=true, Backbone=Gemma4-4B2026.06 | 41 | — | |
| DeepConf TailTraining=false, Backbone=Gemma4-4B2026.06 | 39 | — | |
| ThinkPRM-7BTraining=true, Backbone=Gemma4-4B2026.06 | 38 | — | |
| Mem0+GRPOCategory=Memory-Augmented RL-based Methods2026.02 | 37.5 | 58.1 | |
| Mem0+GRPOBase Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 37.5 | 58.1 | |
| Gemini-2.5-ProCategory=Closed-source LLMs2026.02 | 35.9 | 42.5 | |
| DeepConf B10Training=false, Backbone=Gemma4-4B2026.06 | 35 | — | |
| Self-CertaintyTraining=false, Backbone=Gemma4-4B2026.06 | 34 | — | |
| ThinkPRM-14BTraining=true, Backbone=Qwen3.5-9B2026.06 | 33 | — | |
| GRPOBackbone=Qwen3-1.7B, Setting=RL Training2026.04 | 32 | 63 | |
| Greedy DecodingTraining=false, Backbone=Gemma4-4B2026.06 | 32 | — | |
| DeepConf B10Training=false, Backbone=Qwen3.5-9B2026.06 | 30 | — | |
| ReflexionBackbone=Qwen2.5-7B-Instruct, Setting=Prompting2026.04 | 29 | 62.1 | |
| ReflexionCategory=Prompt-based Agentic or Memory-based Methods, Replicated=true2026.02 | 28.8 | 58.1 | |
| DeepConf TailTraining=false, Backbone=Qwen3.5-9B2026.06 | 28 | — | |
| Mean-of-NTraining=false, Backbone=Qwen3.5-9B2026.06 | 26.4 | — | |
| WildReward-8BTraining=true, Backbone=Qwen3.5-9B2026.06 | 26 | — | |
| ReflexionBackbone=Qwen3-4B, Setting=Prompting2026.04 | 24 | 57.8 | |
| GPT-4oCategory=Closed-source LLMs2026.02 | 23.7 | 31.8 | |
| ThinkPRM-7BTraining=true, Backbone=Qwen3.5-9B2026.06 | 22 | — | |
| Self-CertaintyTraining=false, Backbone=Qwen3.5-9B2026.06 | 22 | — | |
| Greedy DecodingTraining=false, Backbone=Qwen3.5-9B2026.06 | 21 | — | |
| ReActCategory=Prompt-based Agentic or Memory-based Methods, Replicated=true2026.02 | 19.5 | 46.2 | |
| EvolveRCategory=Memory-Augmented RL-based Methods2026.02 | 17.6 | 42.5 | |
| ReAct w/ SGBackbone=Qwen3-4B, Setting=Prompting2026.04 | 17.6 | 42.7 | |
| ReFlActBackbone=Qwen3-4B, Setting=Prompting2026.04 | 16 | 35.1 | |
| ReflexionBackbone=Qwen3-1.7B, Setting=Prompting2026.04 | 16 | 39.8 | |
| ReAct w/ SGBackbone=Qwen2.5-7B-Instruct, Setting=Prompting2026.04 | 13.3 | 31.4 | |
| ReActBackbone=Qwen3-4B, Setting=Prompting2026.04 | 11.3 | 31.1 | |
| ExpeLCategory=Prompt-based Agentic or Memory-based Methods2026.02 | 11.2 | 30.9 | |
| ReFlActBackbone=Qwen2.5-7B-Instruct, Setting=Prompting2026.04 | 10.2 | 28.6 | |
| MemRLCategory=Memory-Augmented RL-based Methods2026.02 | 9.2 | 29.5 | |
| MemRLBase Model=Qwen2.5-7B-Instruct, Type=RL Methods2026.03 | 9.2 | 29.5 | |
| SimpleMemCategory=Prompt-based Agentic or Memory-based Methods2026.02 | 8.59 | 33.2 | |
| Qwen2.5Backbone=Qwen2.5-7B-Instruct2026.02 | 7.8 | 26.4 | |
| ReActBackbone=Qwen2.5-7B-Instruct, Setting=Prompting2026.04 | 7.8 | 19.6 | |
| MemPCategory=Prompt-based Agentic or Memory-based Methods2026.02 | 6.4 | 25.3 | |
| ReAct w/ SGBackbone=Qwen3-1.7B, Setting=Prompting2026.04 | 5.4 | 39.7 | |
| ReActBackbone=Qwen3-1.7B, Setting=Prompting2026.04 | 4.7 | 41.6 | |
| ReFlActBackbone=Qwen3-1.7B, Setting=Prompting2026.04 | 4.4 | 37.5 | |
| Mem0Category=Prompt-based Agentic or Memory-based Methods2026.02 | 2 | 23.9 | |
| HiPERBackbone=Qwen2.5-7B-Instruct2026.02 | 0.833 | 92.2 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.02 | 0.752 | 86.2 | |
| HiPERBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.714 | 85.7 | |
| PPOBackbone=Qwen2.5-7B-Instruct2026.02 | 0.687 | 81.4 | |
| GiGPOBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.674 | 83.5 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 0.661 | 79.3 | |
| RLOOBackbone=Qwen2.5-7B-Instruct2026.02 | 0.657 | 80.3 | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.568 | 75.8 | |
| RLOOBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.521 | 73.9 | |
| PPOBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.515 | 73.8 | |
| Base ModelBackbone=Qwen2.5-7B-Instruct2026.02 | 0.195 | 46.2 | |
| Base ModelBackbone=Qwen2.5-1.5B-Instruct2026.02 | 0.055 | 25.1 |