Agentic Task Performance on ALFWorld Seen
85Success Rate (SR)ExpGraph
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ExpGraphExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM)2026.05 | 85 | 17.6 | |
| S3Executor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 77.1 | 21.8 | |
| Search-o1Executor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 76.1 | 22.4 | |
| IRCoTExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 75.4 | 27 | |
| AWMExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 73.1 | 24.7 | |
| ExpeLExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 71.6 | 21.4 | |
| LightMemExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 70.1 | 27.8 | |
| ExpGraphExecutor LLM=Qwen3-32B (Small LLM)2026.05 | 70 | 20 | |
| ReasoningBankExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 67.2 | 29.1 | |
| ReActExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Prompt-based Agentic Baselines2026.05 | 65.7 | 24.1 | |
| ReflexionExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Prompt-based Agentic Baselines2026.05 | 63.1 | 23.3 | |
| No-MemoryExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=No-Memory2026.05 | 62.7 | 27.9 | |
| MemRLExecutor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 61.9 | 28.9 | |
| S3Executor LLM=Qwen3-32B (Small LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 58.6 | 23.5 | |
| Mem0Executor LLM=Gemini-3.1-Flash-Lite (Large LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 58.2 | 30.6 | |
| ExpeLExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 54.3 | 27.5 | |
| LightMemExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 49.2 | 29.6 | |
| ReasoningBankExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 37.9 | 35.3 | |
| AWMExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 37.9 | 35.3 | |
| IRCoTExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 33.6 | 37.9 | |
| Search-o1Executor LLM=Qwen3-32B (Small LLM), Method Strategy Category=LLM-Centric Experience Learning Baselines2026.05 | 32.1 | 38 | |
| ReActExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Prompt-based Agentic Baselines2026.05 | 31.4 | 36.7 | |
| Mem0Executor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 30 | 37.3 | |
| MemRLExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Retrieval-Centric Experience Learning Baselines2026.05 | 25.7 | 40.3 | |
| ReflexionExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=Prompt-based Agentic Baselines2026.05 | 23.6 | 40.6 | |
| No-MemoryExecutor LLM=Qwen3-32B (Small LLM), Method Strategy Category=No-Memory2026.05 | 19.3 | 41.2 |