Interactive Decision-Making on ALFWorld (OOD)
56.43Success RateMulti2
Evaluation Results
| Method | Links | |
|---|---|---|
| Multi2Base Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 56.43 | |
| Multi2Base Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 50.71 | |
| Multi2Base Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 49.29 | |
| GliderBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 45.71 | |
| GliderBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 41.43 | |
| GliderBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Hierarchical2026.06 | 37.86 | |
| ReflexionBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 29.29 | |
| ReflexionBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 25.36 | |
| ReflexionBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 22.83 | |
| ADaPTBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 10.26 | |
| GRPOBase Model=Llama-3.1 8B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 7.5 | |
| ReActBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Single2026.06 | 7.46 | |
| GRPOBase Model=Mistral 7B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 7.1 | |
| ReActBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Single2026.06 | 6.72 | |
| GRPOBase Model=Qwen-2.5 3B, Training Type=Fine-tuning-based, Structure Type=Single2026.06 | 6.43 | |
| ADaPTBase Model=Llama-3.1 8B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 6.41 | |
| ReActBase Model=Qwen-2.5 3B, Training Type=Prompt-based, Structure Type=Single2026.06 | 5.22 | |
| ADaPTBase Model=Mistral 7B, Training Type=Prompt-based, Structure Type=Hierarchical2026.06 | 5.13 |