Interactive Agent Decision Making on ScienceWorld Continual-memory deployment
41.1Success RateAuto-Dreamer
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Auto-DreamerMemory Category=Ours, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 41.1 | 6,947 | 0.411 | |
| UMEMMemory Category=RL-trained writers, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 34.1 | 80,918 | 0.353 | |
| ReasoningBankMemory Category=Structured stores, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 30.9 | 155,117 | 0.324 | |
| MempMemory Category=Workflow / procedural memory, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 30.4 | 11,531 | 0.306 | |
| AWMMemory Category=Workflow / procedural memory, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 30.2 | 3,877 | 0.311 | |
| Mem-αMemory Category=RL-trained writers, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Released 4B checkpoint2026.05 | 30 | 344,599 | 0.297 | |
| ReflexionMemory Category=Reflective / insight extraction, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 29.6 | 49,936 | 0.306 | |
| No memoryMemory Category=Baseline, Frozen Task Agent LLM=Qwen3.5-9B2026.05 | 28.7 | 0 | 0.295 | |
| ExpeLMemory Category=Reflective / insight extraction, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 28.3 | 11,628 | 0.289 | |
| LightMemMemory Category=Two-timescale prompted, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 28.1 | 272,074 | 0.287 | |
| Mem0Memory Category=Structured stores, Frozen Task Agent LLM=Qwen3.5-9B, Memory-generation LLM=Qwen3-14B2026.05 | 26.8 | 89,854 | 0.281 |