Interactive Decision Making on ALFWorld Seen
97.86Success RateSTEP-HRL
Evaluation Results
| Method | Links | |
|---|---|---|
| STEP-HRLBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 97.86 | |
| STEP-HRLBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 97.14 | |
| STEP-HRLBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 96.43 | |
| SFT+HSLBackbone=Llama3.2-1b2026.07 | 93.57 | |
| DPO+HSLBackbone=Llama3.2-1b2026.07 | 92.86 | |
| BAGELBackbone=Llama3.2-1b2026.07 | 88.09 | |
| BPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 87.9 | |
| DPOBackbone=Llama3.2-1b2026.07 | 84.52 | |
| MPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 82.9 | |
| BEHAVIORCLONEBackbone=Llama3.2-1b2026.07 | 80.72 | |
| SFTApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 80 | |
| SFTBackbone=Llama3.2-1b2026.07 | 79.52 | |
| ETOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 78.6 | |
| WKMBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 73.57 | |
| GLIDERBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 72.12 | |
| Qwen-2.5-7B-InstructApproach=System-1, Evaluation Protocol=Zero-shot, Model Category=Base Models2025.08 | 72.1 | |
| GLIDERBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 71.56 | |
| WKMBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 70.71 | |
| GLIDERBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 70.02 | |
| SELFIMITBackbone=Llama3.2-1b2026.07 | 69.05 | |
| WKMBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 68.57 | |
| REACTBackbone=GPT-4, Evaluation Protocol=Prompt-based2026.04 | 67.32 | |
| ETOBackbone=Mistral-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 66.84 | |
| ETOBackbone=Gemma-7B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 66.43 | |
| ETOBackbone=Llama-3-8B, Evaluation Protocol=Fine-tuning (LoRA)2026.04 | 64.29 | |
| Deepseek-R1Approach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 61.4 | |
| o3-miniApproach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 58.9 | |
| ADAMEMMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Traj., Short Term=Strat.2026.06 | 54 | |
| SynapseMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Traj., Short Term=Traj.2026.06 | 52.1 | |
| Qwen-3-8B-ThinkingApproach=System-2, Evaluation Protocol=Zero-shot, Model Category=Reasoning LLMs2025.08 | 49.3 | |
| ReasoningBankMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=Strat., Short Term=Strat.2026.06 | 49.3 | |
| ADAMEMMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Traj., Short Term=Strat.2026.06 | 47.4 | |
| No MemoryMemory Policy Setup=On-Policy, Backbone=Qwen3-4B-Instruct, Long Term=-, Short Term=-2026.06 | 45.2 | |
| ReasoningBankMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Strat., Short Term=Strat.2026.06 | 45.2 | |
| No MemoryMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=-, Short Term=-2026.06 | 36.7 | |
| SynapseMemory Policy Setup=Off-Policy, Backbone=Gemma-3-27b-it, Long Term=Traj., Short Term=Traj.2026.06 | 35 | |
| Llama-3.1-8B-InstructApproach=System-1, Evaluation Protocol=Zero-shot, Model Category=Base Models2025.08 | 32.9 | |
| SwitchSageBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 30.29 | |
| SwitchSageBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 20.39 | |
| REACTBackbone=GPT-3.5-Turbo, Evaluation Protocol=Prompt-based2026.04 | 15.41 | |
| ReflexionBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 11.56 | |
| SwitchSageBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 8.23 | |
| ReActBackbone=Mistral-7B, Evaluation Protocol=Prompt-based2026.04 | 7.86 | |
| ReflexionBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 7.14 | |
| ReActBackbone=Gemma-7B, Evaluation Protocol=Prompt-based2026.04 | 6.43 | |
| ReflexionBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 4.29 | |
| ReActBackbone=Llama-3-8B, Evaluation Protocol=Prompt-based2026.04 | 2.86 |