Interactive Decision Making on WebShop
84.02Success RateSAMPO
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| SAMPODimension=Ours, Base Model=Qwen3-8B (SFT version)2026.02 | 84.02 | 93.43 | |
| GRPO_STDimension=Loss Agg, Base Model=Qwen3-8B (SFT version)2026.02 | 83.57 | 91.21 | |
| GSPODimension=Importance Sampling, Base Model=Qwen3-8B (SFT version)2026.02 | 83.15 | 91.61 | |
| DAPO_GIGPODimension=Dynamic Sampling, Base Model=Qwen3-8B (SFT version)2026.02 | 82.42 | 91.92 | |
| GIGPODimension=Advantage Design, Base Model=Qwen3-8B (SFT version)2026.02 | 78.91 | 89.26 | |
| GAGPOType=RL Training, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 78.1 | 88.6 | |
| GAGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.05 | 77.5 | 90.3 | |
| GIGPO w/ PaWType=RL Training, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 76.7 | 87.6 | |
| DAPO_GRPODimension=Dynamic Sampling, Base Model=Qwen3-8B (SFT version)2026.02 | 76.52 | 86.52 | |
| EMPGDimension=Advantage Design, Base Model=Qwen3-8B (SFT version)2026.02 | 75.46 | 88.6 | |
| GIGPO w/ PaWType=RL Training, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 75.3 | 87.7 | |
| SAPODimension=Importance Sampling, Base Model=Qwen3-8B (SFT version)2026.02 | 74.47 | 84.73 | |
| GRPODimension=Base, Base Model=Qwen3-8B (SFT version)2026.02 | 73.98 | 85.48 | |
| GIGPOType=RL Training, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 73.8 | 85 | |
| CISPODimension=Importance Sampling, Base Model=Qwen3-8B (SFT version)2026.02 | 73.74 | 87.8 | |
| GiGPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.05 | 73.3 | 86.3 | |
| OPTRole=Teacher, Size=13B2025.05 | 73.2 | — | |
| LLaMARole=Teacher, Size=13B2025.05 | 71.8 | — | |
| GRPO w/ PaWType=RL Training, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 70.5 | 84.5 | |
| DPO+HSLBackbone=Llama3.2-1b2026.07 | 70.28 | — | |
| DPOBackbone=Llama3.2-1b2026.07 | 69.27 | — | |
| PPO (with critic)Type=RL Training, Backbone=Qwen2.5-7B-Instruct2026.05 | 68.7 | 81.4 | |
| GRPO w/ PaWType=RL Training, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 68.6 | 83.8 | |
| GRPOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.05 | 66.8 | 80.5 | |
| GRPOType=RL Training, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 66.5 | 75.4 | |
| SFT+HSLBackbone=Llama3.2-1b2026.07 | 66.48 | — | |
| GRPOType=RL Training, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 66.4 | 80.5 | |
| GIGPOType=RL Training, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 66.2 | 83.2 | |
| RLOOType=RL Training, Backbone=Qwen2.5-7B-Instruct2026.05 | 65.7 | 80.3 | |
| Structured Agent DistillationTeacher=LLaMA-13B, Student Size=7B2025.05 | 64.1 | — | |
| Structured Agent DistillationTeacher=OPT-13B, Student Size=6.7B2025.05 | 63.8 | — | |
| BAGELBackbone=Llama3.2-1b2026.07 | 63.46 | — | |
| SELFIMITBackbone=Llama3.2-1b2026.07 | 62.77 | — | |
| SFTBackbone=Llama3.2-1b2026.07 | 62.61 | — | |
| GiGPOType=RL Training, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 62.5 | 79.8 | |
| BEHAVIORCLONEBackbone=Llama3.2-1b2026.07 | 61.68 | — | |
| GRPOType=RL Training, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 60.6 | 75.6 | |
| Token-level baselineTeacher=LLaMA-13B, Student Size=7B2025.05 | 59.3 | — | |
| Token-level baselineTeacher=OPT-13B, Student Size=6.7B2025.05 | 58.6 | — | |
| SeqKDTeacher=LLaMA-13B, Student Size=7B2025.05 | 56.8 | — | |
| Structured Agent DistillationTeacher=OPT-13B, Student Size=2.7B2025.05 | 56.4 | — | |
| KDTeacher=LLaMA-13B, Student Size=7B2025.05 | 55.2 | — | |
| SeqKDTeacher=OPT-13B, Student Size=6.7B2025.05 | 54.8 | — | |
| KDTeacher=OPT-13B, Student Size=6.7B2025.05 | 53.5 | — | |
| RLOOType=RL Training, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 52.1 | 73.9 | |
| PPO (with critic)Type=RL Training, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 51.5 | 73.8 | |
| Token-level baselineTeacher=OPT-13B, Student Size=2.7B2025.05 | 51 | — | |
| Neuro-Symbolic Dual Memory Framework2026.04 | 51 | 71.32 | |
| Structured Agent DistillationTeacher=OPT-13B, Student Size=1.3B2025.05 | 48.7 | — | |
| SeqKDTeacher=OPT-13B, Student Size=2.7B2025.05 | 47.3 | — | |
| KDTeacher=OPT-13B, Student Size=2.7B2025.05 | 45.7 | — | |
| Token-level baselineTeacher=OPT-13B, Student Size=1.3B2025.05 | 43.2 | — | |
| SeqKDTeacher=OPT-13B, Student Size=1.3B2025.05 | 39.5 | — | |
| KDTeacher=OPT-13B, Student Size=1.3B2025.05 | 38.1 | — | |
| Gemini-2.5-ProType=Prompting, Backbone=Closed-Source Model2026.05 | 35.9 | 42.5 | |
| Gemini-2.5-ProType=Prompting, Base Model Series=Closed-Source Model2026.06 | 35.9 | 42.5 | |
| Reflexion2026.04 | 35 | 52.04 | |
| WALL-E 2.02026.04 | 34 | 59.98 | |
| ReAct2026.04 | 32 | 50.1 | |
| ADaPT2026.04 | 32 | 53.55 | |
| AWM2026.04 | 32 | 51.6 | |
| ExpeL2026.04 | 29 | 45.82 | |
| ReflexionType=Prompting, Backbone=Qwen2.5-7B-Instruct2026.05 | 28.8 | 58.1 | |
| ReflexionType=Prompting, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 28.8 | 58.1 | |
| GPT-4oType=Prompting, Backbone=Closed-Source Model2026.05 | 23.7 | 31.8 | |
| GPT-4oType=Prompting, Base Model Series=Closed-Source Model2026.06 | 23.7 | 31.8 | |
| ReflexionType=Prompting, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 21.9 | 55.8 | |
| ReflexionType=Prompting, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 21.9 | 55.8 | |
| ReActType=Prompting, Backbone=Qwen2.5-7B-Instruct2026.05 | 19.5 | 46.2 | |
| ReActType=Prompting, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 19.5 | 46.2 | |
| StateAct2026.04 | 17 | 29.73 | |
| ReActType=Prompting, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 11.3 | 40.1 | |
| ReActType=Prompting, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 11.3 | 40.1 | |
| Qwen2.5Type=Prompting, Backbone=Qwen2.5-7B-Instruct2026.05 | 7.8 | 26.4 | |
| Qwen2.5Type=Prompting, Base Model Series=Qwen2.5-7B-Instruct2026.06 | 7.8 | 26.4 | |
| Qwen2.5Type=Prompting, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 5.2 | 23.1 | |
| Qwen2.5Type=Prompting, Base Model Series=Qwen2.5-1.5B-Instruct2026.06 | 5.2 | 23.1 | |
| AMC (ReAct)Policy Model=Llama-3.2-11B, Number of Trajectories (N)=15, Value Model=Llama-3.2-11B2026.06 | — | 62.5 | |
| AMC (ReAct)Policy Model=GPT-4.1-mini, Number of Trajectories (N)=15, Value Model=Llama-3.2-11B2026.06 | — | 48.8 | |
| AMC (ReAct)Policy Model=GPT-5.1, Number of Trajectories (N)=15, Value Model=Llama-3.2-11B2026.06 | — | 54.3 | |
| Best-of-15 (ReAct)Policy Model=Llama-3.2-11B, Number of Trajectories (N)=152026.06 | — | 56.2 | |
| Best-of-15 (ReAct)Policy Model=GPT-4.1-mini, Number of Trajectories (N)=152026.06 | — | 40.3 | |
| Best-of-15 (ReAct)Policy Model=GPT-5.1, Number of Trajectories (N)=152026.06 | — | 51.9 | |
| CoTBackbone=GPT-3.5-turbo-03012026.05 | — | 56.9 | |
| DyLANBackbone=GPT-3.5-turbo-03012026.05 | — | 68.3 | |
| MaASBackbone=GPT-3.5-turbo-03012026.05 | — | 69.7 | |
| MANGOBackbone=GPT-3.5-turbo-03012026.05 | — | 75 | |
| ReActPolicy Model=Llama-3.2-11B, Number of Trajectories (N)=12026.06 | — | 15.9 | |
| ReActPolicy Model=GPT-4.1-mini, Number of Trajectories (N)=12026.06 | — | 11.3 | |
| ReActPolicy Model=GPT-5.1, Number of Trajectories (N)=12026.06 | — | 17.1 | |
| SMC (FoA-ReAct)Policy Model=Llama-3.2-11B, Number of Trajectories (N)=15, Value Model=Llama-3.2-11B2026.06 | — | 58 |