Interactive Decision Making on ALFWorld unseen (test)
88.81Average RewardAdaPlan-H
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 88.81 | — | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 82.84 | — | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 82.84 | — | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 79.85 | — | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 78.36 | — | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Qwen2.5-7B2026.04 | 75.37 | — | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 73.88 | — | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 72.3 | — | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Qwen3-8B2026.04 | 71.64 | — | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 69.4 | — | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 58.96 | — | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 55.22 | — | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Chatglm-9B2026.04 | 54.48 | — | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 54.48 | — | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 52.99 | — | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 52.24 | — | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=GPT-4o-mini2026.04 | 40.3 | — | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 38.81 | — | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 20.9 | — | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Llama-3.1-8B2026.04 | 18.66 | — | — | — | — | — | — | — | |
| BaseBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 5.9 | 5.5 | 3.3 | 9.7 | 4.2 | 0 | 4.1 | |
| BaseBackbone=Qwen2.5-7B-Instruct2026.02 | — | 34.8 | 22.9 | 18.1 | 7.3 | 2.5 | 3.6 | 16.2 | |
| Gemini-2.5-ProBackbone=Closed-Source LLMs2026.02 | — | 92.8 | 63.3 | 62.1 | 69 | 26.6 | 58.7 | 60.3 | |
| GiGPOBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 95.3 | 80.2 | 92.9 | 92.7 | 70.6 | 78.5 | 85.2 | |
| GiGPOBackbone=Qwen2.5-7B-Instruct2026.02 | — | 97.5 | 81.3 | 88.5 | 85.7 | 90 | 83.5 | 89.5 | |
| GPT-4oBackbone=Closed-Source LLMs2026.02 | — | 75.3 | 60.8 | 31.2 | 56.7 | 21.6 | 49.8 | 48 | |
| GRPOBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 80 | 50 | 75 | 88.9 | 63.2 | 50 | 70.3 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | — | 90.7 | 66.2 | 94.1 | 91.2 | 78.9 | 70.5 | 79.8 | |
| ProxMOBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 94.3 | 92.9 | 89.3 | 92.2 | 89.5 | 87 | 90.6 | |
| ProxMOBackbone=Qwen2.5-7B-Instruct2026.02 | — | 98.4 | 88.6 | 95.7 | 93.8 | 91.3 | 89.8 | 94.5 | |
| ReActBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 17.4 | 20.5 | 15.7 | 6.2 | 7.7 | 2 | 12.8 | |
| ReActBackbone=Qwen2.5-7B-Instruct2026.02 | — | 50.1 | 33.8 | 35.7 | 12.5 | 17.3 | 18.9 | 29.8 | |
| ReflexionBackbone=Qwen2.5-1.5B-Instruct2026.02 | — | 37.8 | 24 | 23.3 | 14.5 | 20.7 | 3.9 | 23.5 | |
| ReflexionBackbone=Qwen2.5-7B-Instruct2026.02 | — | 63.4 | 40.2 | 46.5 | 29.7 | 37.9 | 22.6 | 44.1 |