Multi-turn decision making on ALFWorld (val-unseen)
94.1Success RateLoRA baseline
Evaluation Results
| Method | Links | |
|---|---|---|
| LoRA baselineBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 94.1 | |
| Rule-based ExpertBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 89.6 | |
| ITPRBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 85.1 | |
| SANDBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 85 | |
| ExpRAG baselineBackbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 83.6 | |
| SFT + ReActBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 80.7 | |
| ETO + ReActBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 79.9 | |
| Self-ReflectionBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 71.1 | |
| IWMBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 70.3 | |
| NAT + ReActBackbone=Qwen 2.5-7B, Paradigm=Supervised Fine-tuned2026.03 | 66.4 | |
| ReflexionBackbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 42.7 | |
| Memory BankBackbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 40.3 | |
| AgeMem-noRLBackbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 37.9 | |
| ITPIBackbone=Qwen 2.5-7B, Paradigm=Prompting2026.03 | 35.7 | |
| A-MEMBackbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 34.7 | |
| Mem0Backbone=Qwen 2.5-7B, Paradigm=Training-Free Memory-Augmented2026.03 | 33.6 | |
| Zero-shotBackbone=Qwen 2.5-7B, Paradigm=Prompting2026.03 | 29.9 | |
| ReActBackbone=Qwen 2.5-7B, Paradigm=Prompting2026.03 | 17.1 |