Interactive Agent Decision Making on ALFWorld Continual-memory deployment
60.2Success RateAuto-Dreamer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Auto-DreamerMemory Category=Ours, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 60.2 | 10,954 | 58.5 | |
| UMEMMemory Category=RL-trained writers, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 58.4 | 62,947 | 56.4 | |
| Mem-αMemory Category=RL-trained writers, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Released 4B checkpoint2026.05 | 57.4 | 125,635 | 56.6 | |
| ReflexionMemory Category=Reflective / insight extraction, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 49.2 | 11,967 | 47.5 | |
| ExpeLMemory Category=Reflective / insight extraction, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 33.6 | 2,042 | 30.6 | |
| AWMMemory Category=Workflow / procedural memory, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 32.8 | 16,846 | 30.6 | |
| MempMemory Category=Workflow / procedural memory, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 31.4 | 6,731 | 29.7 | |
| LightMemMemory Category=Two-timescale prompted, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 31.2 | 130,001 | 28.8 | |
| ReasoningBankMemory Category=Structured stores, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 31.1 | 42,784 | 28.5 | |
| No memoryMemory Category=Baseline, Frozen Task Agent LLM=Qwen3.5-9B2026.05 | 30.8 | 0 | 28.7 | |
| Mem0Memory Category=Structured stores, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 30.6 | 119,013 | 27.9 |