Interactive Decision Making on ALFWorld Unseen
97.76Success RateSTEP-HRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| STEP-HRLBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 97.76 | — | |
| STEP-HRLBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 97.76 | — | |
| STEP-HRLBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 97.01 | — | |
| SFT+HSLBackbone=Llama3.2-1b2026.07 | 96.27 | — | |
| DPO+HSLBackbone=Llama3.2-1b2026.07 | 95.27 | — | |
| SKILLPYRAMIDModel=Qwen3-235B2026.06 | 91 | 11 | |
| BPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 89.6 | — | |
| BAGELBackbone=Llama3.2-1b2026.07 | 87.06 | — | |
| SKILLPYRAMIDModel=GPT-4.12026.06 | 85.1 | 13.1 | |
| SKILLPYRAMIDModel=DeepSeek-V3.22026.06 | 84.8 | 10.6 | |
| DPOBackbone=Llama3.2-1b2026.07 | 81.09 | — | |
| ReAct + SkillsModel=DeepSeek-V3.22026.06 | 80.6 | 14.7 | |
| SKILLPYRAMIDModel=Gemini 2.5 Pro2026.06 | 80.6 | 11.9 | |
| BEHAVIORCLONEBackbone=Llama3.2-1b2026.07 | 79.85 | — | |
| MPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 78.4 | — | |
| WKMBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 76.87 | — | |
| Qwen-2.5-7B-InstructApproach=System-1, Evaluation Protocol=Zero-shot, Model Category=Base Models2025.08 | 76.1 | — | |
| ExpeLModel=DeepSeek-V3.22026.06 | 76.1 | 17.4 | |
| SFTBackbone=Llama3.2-1b2026.07 | 75.87 | — | |
| ReAct + SkillsModel=GPT-4.12026.06 | 75.8 | 16.2 | |
| GLIDERBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 75.38 | — | |
| GLIDERBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 74.83 | — | |
| ReAct + SkillsModel=Gemini 2.5 Pro2026.06 | 73.9 | 16.7 | |
| ReflexionModel=DeepSeek-V3.22026.06 | 73.6 | 18 | |
| SFTApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 71.6 | — | |
| ETOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 71.6 | — | |
| ETOBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 71.43 | — | |
| GLIDERBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 70.88 | — | |
| WKMBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 70.4 | — | |
| ExpeLModel=Gemini 2.5 Pro2026.06 | 70.2 | 17 | |
| ReActModel=DeepSeek-V3.22026.06 | 69.4 | 19.3 | |
| ReflexionModel=Gemini 2.5 Pro2026.06 | 69.4 | 17.7 | |
| ETOBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 68.66 | — | |
| ReAct + SkillsModel=Qwen3-235B2026.06 | 68.6 | 18.3 | |
| Qwen-3-8B-ThinkingApproach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 67.2 | — | |
| WKMBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 65.93 | — | |
| REACTBackbone=GPT-4, Evaluation Protocol=Prompt-based2026.04 | 65.09 | — | |
| ExpeLModel=GPT-4.12026.06 | 64.8 | 17.4 | |
| ETOBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 64.18 | — | |
| ReflexionModel=GPT-4.12026.06 | 62.8 | 18.6 | |
| o3-miniApproach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 62.7 | — | |
| ExpeLModel=Qwen3-235B2026.06 | 62.4 | 17.8 | |
| ReActModel=Gemini 2.5 Pro2026.06 | 61.9 | 19.2 | |
| ReflexionModel=Qwen3-235B2026.06 | 60.2 | 19.5 | |
| ADAMEMMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Traj., Short Term=Strat.2026.06 | 58.2 | — | |
| SELFIMITBackbone=Llama3.2-1b2026.07 | 57.46 | — | |
| ReActModel=GPT-4.12026.06 | 56.1 | 20.4 | |
| ReActModel=Qwen3-235B2026.06 | 53.8 | 21 | |
| Deepseek-R1Approach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 53.7 | — | |
| SynapseMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Traj., Short Term=Traj.2026.06 | 52.2 | — | |
| ReasoningBankMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Strat., Short Term=Strat.2026.06 | 51.2 | — | |
| ADAMEMMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Traj., Short Term=Strat.2026.06 | 49.5 | — | |
| No MemoryMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=-, Short Term=-2026.06 | 46.8 | — | |
| ReasoningBankMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Strat., Short Term=Strat.2026.06 | 44.8 | — | |
| Llama-3.1-8B-InstructApproach=System-1, Evaluation Protocol=Zero-shot, Model Category=Base Models2025.08 | 40.3 | — | |
| No MemoryMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=-, Short Term=-2026.06 | 37.6 | — | |
| SynapseMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Traj., Short Term=Traj.2026.06 | 30.6 | — | |
| SwitchSageBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 26.52 | — | |
| REACTBackbone=GPT-3.5-Turbo, Evaluation Protocol=Prompt-based2026.04 | 13.99 | — | |
| SwitchSageBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 10.78 | — | |
| ReflexionBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 6 | — | |
| SwitchSageBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 5.72 | — | |
| ReActBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 5.22 | — | |
| ReflexionBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 4.48 | — | |
| ReActBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 3.73 | — | |
| ReflexionBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 2.99 | — | |
| ReActBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 2.24 | — |