Interactive Decision Making on ALFWorld Seen (val)
100Pick RewardSCPO
Evaluation Results
| Method | Links | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| SCPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 100 | — | 100 | 97.2 | 92.9 | 89.3 | 94.3 | 95.3 | |
| HCAPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 99.1 | — | 90.3 | 97.3 | 81.8 | 90.8 | 81.9 | 91.4 | |
| GiGPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 97.7 | — | 82.7 | 98.8 | 83.7 | 89.3 | 79.2 | 90.8 | |
| SCPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 96 | — | 88.6 | 93.4 | 96.5 | 92.8 | 90.9 | 93.7 | |
| GiGPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 94.4 | — | 67.5 | 94.8 | 94.4 | 79.8 | 76.4 | 86.7 | |
| EMPGType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 92.9 | — | 75.2 | 74.8 | 86.3 | 73.7 | 65.3 | 78.5 | |
| Gemini-2.5-ProType=Closed-source LLMs2026.06 | 92.8 | — | 63.3 | 62.1 | 69 | 26.6 | 58.7 | 60.3 | |
| Gemini-2.5-ProType=Prompt-based2026.07 | 92.8 | 60.3 | 69 | 63.3 | 26.6 | 62.1 | 58.7 | — | |
| PPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 92.3 | — | 64 | 92.5 | 89.5 | 80.3 | 68.8 | 80.4 | |
| GRPOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 90.8 | — | 66.1 | 89.3 | 74.7 | 72.5 | 64.7 | 77.6 | |
| HCAPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 88.6 | — | 75 | 97.6 | 90.7 | 84.2 | 74.2 | 87 | |
| RLOOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 88.3 | — | 52.8 | 71 | 62.8 | 66.4 | 56.9 | 69.7 | |
| RLOOType=RL-based2026.07 | 88.3 | 69.7 | 62.8 | 52.8 | 66.4 | 71 | 56.9 | — | |
| RLOOType=RL, Backbone=Qwen2.5-7B-Instruct2026.06 | 87.6 | — | 78.2 | 87.3 | 81.3 | 71.9 | 48.9 | 75.5 | |
| EMPGType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 85.5 | — | 33.5 | 78.9 | 76.2 | 74.7 | 69.1 | 73.7 | |
| GRPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 85.3 | — | 53.7 | 84.5 | 78.2 | 59.7 | 53.5 | 72.8 | |
| ProGPOType=RL-based2026.07 | 79.3 | 90.1 | 100 | 86.9 | 94.9 | 98 | 84.6 | — | |
| HGPOType=RL-based2026.07 | 78.3 | 87.8 | 97.2 | 83.6 | 86.5 | 89.2 | 99.1 | — | |
| GPT-4oType=Closed-source LLMs2026.06 | 75.3 | — | 60.8 | 31.2 | 56.7 | 21.6 | 49.8 | 48 | |
| GPT-4oType=Prompt-based2026.07 | 75.3 | 48 | 56.7 | 60.8 | 21.6 | 31.2 | 49.8 | — | |
| GiGPOType=RL-based2026.07 | 73.9 | 85.5 | 99.6 | 85.6 | 83.1 | 88.8 | 84.9 | — | |
| GRPOType=RL-based2026.07 | 68.5 | 75.8 | 83.4 | 79.1 | 80.2 | 80.5 | 60.1 | — | |
| PPOType=RL, Backbone=Qwen2.5-1.5B-Instruct2026.06 | 64.8 | — | 40.5 | 57.1 | 60.6 | 46.4 | 47.4 | 54.4 | |
| PPOType=RL-based2026.07 | 64.8 | 54.4 | 60.6 | 40.5 | 46.4 | 57.1 | 47.4 | — | |
| ReflexionBackbone=Qwen2.5-7B-Instruct2026.06 | 62 | — | 41.6 | 44.9 | 30.9 | 36.3 | 23.8 | 42.7 | |
| ReActBackbone=Qwen2.5-7B-Instruct2026.06 | 48.5 | — | 35.4 | 34.3 | 13.2 | 18.2 | 17.6 | 31.2 | |
| ReflexionBackbone=Qwen2.5-1.5B-Instruct2026.06 | 35.3 | — | 22.2 | 21.7 | 13.6 | 19.4 | 3.7 | 21.8 | |
| ReflexionType=Prompt-based2026.07 | 35.3 | 21.8 | 13.6 | 22.2 | 19.4 | 21.7 | 3.7 | — | |
| Prompting Qwen2.5Backbone=Qwen2.5-7B-Instruct2026.06 | 33.4 | — | 21.6 | 19.3 | 6.9 | 2.8 | 3.2 | 14.8 | |
| ReActBackbone=Qwen2.5-1.5B-Instruct2026.06 | 17.4 | — | 20.5 | 15.7 | 6.2 | 7.7 | 2 | 12.8 | |
| ReActType=Prompt-based2026.07 | 17.4 | 12.8 | 6.2 | 20.5 | 7.7 | 15.7 | 2 | — | |
| Prompting Qwen2.5Backbone=Qwen2.5-1.5B-Instruct2026.06 | 5.9 | — | 5.5 | 3.3 | 9.7 | 4.2 | 0 | 4.1 | |
| Qwen2.5Type=Prompt-based2026.07 | 5.9 | 4.1 | 9.7 | 5.5 | 4.2 | 3.3 | 0 | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | — | 0.5429 | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | — | 0.85 | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | — | 0.8357 | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | — | 0.8677 | — | — | — | — | — | — | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | — | 0.8429 | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | — | 0.2214 | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | — | 0.5643 | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | — | 0.5714 | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | — | 0.4429 | — | — | — | — | — | — | |
| Base Plannerw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | — | 0.4071 | — | — | — | — | — | — | |
| HGPOType=RL, Backbone=Qwen2.5-1.5B-Instruct, K=2, iterations=1602026.06 | — | — | — | — | — | — | — | 92.77 | |
| HGPOType=RL, Backbone=Qwen2.5-7B-Instruct, K=2, iterations=1602026.06 | — | — | — | — | — | — | — | 95.44 | |
| MPOw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | — | 0.5 | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | — | 0.8286 | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | — | 0.7687 | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | — | 0.6643 | — | — | — | — | — | — | |
| MPOw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | — | 0.7643 | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Llama-3.1-8B2026.04 | — | 0.25 | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Qwen2.5-7B2026.04 | — | 0.7173 | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Qwen3-8B2026.04 | — | 0.7286 | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=Chatglm-9B2026.04 | — | 0.5286 | — | — | — | — | — | — | |
| ReActw/o Plan=×, Actor Backbone=GPT-4o-mini2026.04 | — | 0.4357 | — | — | — | — | — | — |