Web Navigation and Shopping on Webshop
100ScoreMemoryBank
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| MemoryBankBackbone=DeepSeek-V3.22026.01 | 100 | — | — | |
| MemoryBank + GLOVEBackbone=DeepSeek-V3.22026.01 | 100 | — | — | |
| Generative AgentBackbone=DeepSeek-V3.22026.01 | 97.5 | — | — | |
| Generative Agent + GLOVEBackbone=DeepSeek-V3.22026.01 | 97.5 | — | — | |
| DAPO+AEMBackbone=Qwen2.5-7B-Instruct2026.05 | 94.5 | 88.9 | — | |
| VanillaBackbone=DeepSeek-V3.22026.01 | 93.8 | — | — | |
| Voyager + GLOVEBackbone=DeepSeek-V3.22026.01 | 93.8 | — | — | |
| DAPOBackbone=Qwen2.5-7B-Instruct2026.05 | 93.7 | 86.7 | — | |
| UCOBBackbone=Qwen2.5-7B-Instruct2026.06 | 91.8 | 85.9 | — | |
| UCOBBackbone=Qwen3-1.7B2026.06 | 91.5 | 79.7 | — | |
| D2SkillBackbone=Qwen2.5-7B-Instruct2026.06 | 91.1 | 80.5 | — | |
| SAPOBackbone=Qwen2.5-7B-Instruct2026.06 | 90.5 | 78.1 | — | |
| VoyagerBackbone=DeepSeek-V3.22026.01 | 90 | — | — | |
| SPARKBackbone=Qwen2.5-7B2026.01 | 89.8 | 82.8 | — | |
| Skill1Base Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=Yes2026.05 | 89.7 | 82.9 | — | |
| BiPACEQType=RL training, Backbone=Qwen2.5-7B-Instruct2026.06 | 89.6 | 79.7 | — | |
| SDARBackbone=Qwen2.5-7B-Instruct2026.06 | 89.4 | 82.8 | — | |
| SCPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 89.3 | 74.8 | — | |
| STAPOType=Process RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 89.1 | 77.6 | — | |
| HGPOType=RL training, Backbone=Qwen2.5-7B-Instruct2026.06 | 89 | 78.5 | — | |
| HGPOType=RL, Backbone=Qwen2.5-7B-Instruct, K=2, iterations=1602026.06 | 88.96 | 78.51 | — | |
| RetroAgentBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=Yes2026.05 | 88.9 | 82.3 | — | |
| SPARKBackbone=Qwen2.5-1.5B2026.01 | 88.8 | 75.8 | — | |
| DAPO_GIGPOBackbone=Qwen3-4B2026.02 | 88.1 | 76.82 | — | |
| SAMPOBackbone=Qwen3-4B2026.02 | 88.04 | 74.08 | — | |
| DAPO+AEMBackbone=Qwen2.5-1.5B-Instruct2026.05 | 88 | 78.5 | — | |
| SCPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 88 | 77.5 | — | |
| RLSDBackbone=Qwen2.5-7B-Instruct2026.06 | 87.4 | 77.3 | — | |
| RLVMRBackbone=Qwen2.5-7B2026.01 | 87.3 | 74.2 | — | |
| GRPO+AEMBackbone=Qwen2.5-7B-Instruct2026.05 | 86.9 | 80.5 | — | |
| RLVMRBackbone=Qwen2.5-1.5B2026.01 | 86.7 | 71.1 | — | |
| DAPOBackbone=Qwen2.5-1.5B-Instruct2026.05 | 86.5 | 75.9 | — | |
| GRPO+AEMBackbone=Qwen2.5-1.5B-Instruct2026.05 | 86.4 | 70.6 | — | |
| Vanilla + GLOVEBackbone=DeepSeek-V3.22026.01 | 86.2 | — | — | |
| GiGPOType=RL training, Backbone=Qwen2.5-7B-Instruct2026.06 | 86.2 | 75.2 | — | |
| Skill1Backbone=Qwen2.5-7B-Instruct2026.06 | 86.2 | 77.3 | — | |
| Skill-SDBackbone=Qwen2.5-7B-Instruct2026.06 | 86.1 | 76.5 | — | |
| STAPOType=Process RL, Base Model=Qwen2.5-1.5B-Instruct2026.07 | 85.9 | 69 | — | |
| BiPACEQType=RL training, Backbone=Qwen2.5-1.5B-Instruct, training budget=extended2026.06 | 85.8 | 71.9 | — | |
| HGPOType=RL training, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 85.6 | 71.5 | — | |
| SkillCBackbone=Qwen2.5-7B-Instruct2026.06 | 85.6 | 74 | — | |
| HGPOType=RL, Backbone=Qwen2.5-1.5B-Instruct, K=2, iterations=1602026.06 | 85.56 | 71.54 | — | |
| GSPOBackbone=Qwen3-4B2026.02 | 85.29 | 72.48 | — | |
| SkillRLBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=Yes2026.05 | 85.2 | 72.7 | — | |
| SkillRLBackbone=Qwen2.5-7B-Instruct2026.06 | 85.2 | 72.7 | — | |
| HCAPOType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 85.1 | 73.8 | — | |
| HCAPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 85.1 | 73.8 | — | |
| SDARBackbone=Qwen2.5-3B-Instruct2026.06 | 85 | 68 | — | |
| UCOBBackbone=Qwen2.5-3B-Instruct2026.06 | 84.5 | 78.1 | — | |
| GiGPOBackbone=Qwen2.5-7B2026.01 | 84.4 | 72.8 | — | |
| GiGPOType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 84.4 | 72.8 | — | |
| GiGPOBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=No2026.05 | 84.4 | 72.8 | — | |
| GiGPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 84.4 | 72.8 | — | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.06 | 84.4 | 72.8 | — | |
| RLSDBackbone=Qwen2.5-3B-Instruct2026.06 | 84.4 | 66.4 | — | |
| GiGPOType=Process RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 84.4 | 72.8 | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 84.1 | 75.9 | — | |
| Skill1Backbone=Qwen2.5-3B-Instruct2026.06 | 84.1 | 75 | — | |
| HCAPOType=RL Training, Base Model=Qwen2.5-1.5B-Instruct2026.03 | 83.8 | 68.5 | — | |
| HCAPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 83.8 | 68.5 | — | |
| GiGPOBackbone=Qwen2.5-3B-Instruct2026.06 | 83.8 | 70.3 | — | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct2026.05 | 83.6 | 65 | — | |
| GiGPOType=RL training, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 83.5 | 67.4 | — | |
| Skill1Backbone=Qwen3-1.7B2026.06 | 83.2 | 61.7 | — | |
| GiGPOBackbone=Qwen2.5-1.5B2026.01 | 83.1 | 65 | — | |
| GiGPOType=RL Training, Base Model=Qwen2.5-1.5B-Instruct2026.03 | 83.1 | 65 | — | |
| GiGPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 83.1 | 65 | — | |
| GiGPOType=Process RL, Base Model=Qwen2.5-1.5B-Instruct2026.07 | 83.1 | 65 | — | |
| Human Expert2022.10 | 82.1 | 59.6 | — | |
| GSPO+AEMBackbone=Qwen2.5-7B-Instruct2026.05 | 81.9 | 72.1 | — | |
| Skill-SDBackbone=Qwen3-1.7B2026.06 | 81.8 | 53.9 | — | |
| PPO (with critic)Type=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 81.4 | 68.7 | — | |
| PPOBackbone=Qwen2.5-7B-Instruct2026.05 | 81.4 | 68.7 | — | |
| PPOBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=No2026.05 | 81.4 | 68.7 | — | |
| PPO (w/ critic)Type=RL training, Backbone=Qwen2.5-7B-Instruct2026.06 | 81.4 | 68.7 | — | |
| PPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 81.4 | 68.7 | — | |
| PPOType=Outcome RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 81.4 | 68.7 | — | |
| EMPGType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 81 | 69.3 | — | |
| EMPGType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 81 | 69.3 | — | |
| EMPGType=Process RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 81 | 69.3 | — | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.06 | 80.9 | 72.6 | — | |
| EMPGType=RL Training, Base Model=Qwen2.5-1.5B-Instruct2026.03 | 80.4 | 60.8 | — | |
| GSPOBackbone=Qwen2.5-7B-Instruct2026.05 | 80.4 | 71.6 | — | |
| EMPGType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 80.4 | 60.8 | — | |
| EMPGType=Process RL, Base Model=Qwen2.5-1.5B-Instruct2026.07 | 80.4 | 60.8 | — | |
| RLOOType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 80.3 | 65.7 | — | |
| RLOOBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=No2026.05 | 80.3 | 65.7 | — | |
| RLOOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 80.3 | 65.7 | — | |
| RLOOType=Outcome RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 80.3 | 65.7 | — | |
| No Memory (Plain)Backbone=DeepSeek-V3.22026.01 | 80 | — | — | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.06 | 79.8 | 63.3 | — | |
| GRPOBackbone=Qwen2.5-7B2026.01 | 79.3 | 66.1 | — | |
| GRPOType=RL Training, Base Model=Qwen2.5-7B-Instruct2026.03 | 79.3 | 66.1 | — | |
| GRPOBase Model=Qwen2.5-7B-Instruct, Training Strategy=RL-Trained, Skill Library=No2026.05 | 79.3 | 66.1 | — | |
| GRPOType=RL training, Backbone=Qwen2.5-7B-Instruct2026.06 | 79.3 | 66.1 | — | |
| GRPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 79.3 | 66.1 | — | |
| GRPOType=Outcome RL, Base Model=Qwen2.5-7B-Instruct2026.07 | 79.3 | 66.1 | — | |
| EMPGBackbone=Qwen3-4B2026.02 | 79.16 | 64.32 | — | |
| SDARBackbone=Qwen3-1.7B2026.06 | 76.8 | 58.6 | — | |
| GSPO+AEMBackbone=Qwen2.5-1.5B-Instruct2026.05 | 76.3 | 66.9 | — |