Interactive Decision Making on ScienceWorld Seen (val)
0.7349Average RewardAdaPlan-H
Evaluation Results
| Method | Links | |
|---|---|---|
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 0.7349 | |
| MPOw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 0.6608 | |
| MPOw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 0.6527 | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 0.6454 | |
| Base Plannerw/o Plan=✓, Actor Backbone=GPT-4o-mini2026.04 | 0.5884 | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 0.5876 | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen3-8B2026.04 | 0.5798 | |
| ReActw/o Plan=×, Actor Backbone=Qwen3-8B2026.04 | 0.5764 | |
| MPOw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 0.5724 | |
| ReActw/o Plan=×, Actor Backbone=GPT-4o-mini2026.04 | 0.5423 | |
| Base Plannerw/o Plan=✓, Actor Backbone=Llama-3.1-8B2026.04 | 0.4817 | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 0.4573 | |
| ReActw/o Plan=×, Actor Backbone=Llama-3.1-8B2026.04 | 0.4367 | |
| MPOw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 0.4303 | |
| Base Plannerw/o Plan=✓, Actor Backbone=Qwen2.5-7B2026.04 | 0.4246 | |
| AdaPlan-Hw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 0.4127 | |
| MPOw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 0.3618 | |
| Base Plannerw/o Plan=✓, Actor Backbone=Chatglm-9B2026.04 | 0.3308 | |
| ReActw/o Plan=×, Actor Backbone=Qwen2.5-7B2026.04 | 0.3103 | |
| ReActw/o Plan=×, Actor Backbone=Chatglm-9B2026.04 | 0.2923 |