Partially Observable Decision Making on WebShop
83.5ScoreGiGPOw/o std
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GiGPOw/o stdParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=32026.05 | 83.5 | 67.4 | |
| GiGPOw/stdParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=32026.05 | 83.1 | 65 | |
| ReBelParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=3, Initialization=SFT warm start2026.05 | 79.8 | 75.1 | |
| GRPOParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=32026.05 | 75.8 | 56.8 | |
| RLOOParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=32026.05 | 73.9 | 52.1 | |
| PPOParadigm=RL, Backbone=Qwen2.5-1.5B-Instruct, Number of seeds=32026.05 | 73.8 | 51.5 | |
| ReflexionParadigm=Prompt, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 55.8 | 21.9 | |
| Gemini-2.5-ProParadigm=Prompt, Evaluation Protocol=zero-shot reference2026.05 | 42.5 | 35.9 | |
| ReActParadigm=Prompt, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 40.1 | 11.3 | |
| GPT-4oParadigm=Prompt, Evaluation Protocol=zero-shot reference2026.05 | 31.8 | 23.7 | |
| Qwen2.5Paradigm=Prompt, Backbone=Qwen2.5-1.5B-Instruct2026.05 | 23.1 | 5.2 |