Exploration on ALFWorld
94.9Success Rate (Last Epoch)MemRL
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| MemRLModel=GPT-5-mini2026.01 | 94.9 | 0.981 | |
| Self-RAGModel=GPT-5-mini2026.01 | 90.7 | 0.962 | |
| Mem0Model=GPT-5-mini2026.01 | 89.4 | 0.969 | |
| E3-TIRBackbone=Qwen2.5-3B-Instruct, Expert Data Trajectories=2K2026.04 | 89 | — | |
| RAGModel=GPT-5-mini2026.01 | 88.7 | 0.93 | |
| MemPModel=GPT-5-mini2026.01 | 88.5 | 0.919 | |
| Zero-RLBackbone=Qwen2.5-3B-Instruct, Expert Data Trajectories=2K2026.04 | 86.5 | — | |
| SFT-then-RLBackbone=Qwen2.5-3B-Instruct, Expert Data Trajectories=2K2026.04 | 81.5 | — | |
| No MemoryModel=GPT-5-mini2026.01 | 77.7 | — | |
| Only SFTBackbone=Qwen2.5-3B-Instruct, Expert Data Trajectories=2K2026.04 | 62.5 | — | |
| Pass@10Model=GPT-5-mini2026.01 | — | 0.928 |