Embodied decision-making on ALFWorld
100Success RateRePro
Evaluation Results
| Method | Links | ||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ReProBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Best2026.06 | 100 | — | — | — | — | — | — | — | — | — | — | 10.26 | |
| L1Backbone Model=Qwen2.5-7B, Metric Aggregation Type=Best2026.06 | 99.61 | — | — | — | — | — | — | — | — | — | — | 9.78 | |
| ReProBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Best2026.06 | 99.22 | — | — | — | — | — | — | — | — | — | — | 9.42 | |
| L2Backbone Model=Qwen2.5-7B, Metric Aggregation Type=Best2026.06 | 98.83 | — | — | — | — | — | — | — | — | — | — | 9.29 | |
| L1Backbone Model=Qwen2.5-7B, Metric Aggregation Type=Avg2026.06 | 97.81 | — | — | — | — | — | — | — | — | — | — | 8.83 | |
| ReProBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Avg2026.06 | 97.54 | — | — | — | — | — | — | — | — | — | — | 8.9 | |
| L2Backbone Model=Qwen2.5-7B, Metric Aggregation Type=Avg2026.06 | 96.6 | — | — | — | — | — | — | — | — | — | — | 8.3 | |
| ReProBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Avg2026.06 | 96.02 | — | — | — | — | — | — | — | — | — | — | 7.94 | |
| L1Backbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Best2026.06 | 95.7 | — | — | — | — | — | — | — | — | — | — | 7.88 | |
| GiGPOBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Best2026.06 | 95.31 | — | — | — | — | — | — | — | — | — | — | 7.82 | |
| Meta PromptBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Best2026.06 | 95.31 | — | — | — | — | — | — | — | — | — | — | 7.97 | |
| Meta PromptBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Avg2026.06 | 91.37 | — | — | — | — | — | — | — | — | — | — | 6.49 | |
| GiGPOBackbone Model=Qwen2.5-7B, Metric Aggregation Type=Avg2026.06 | 90.08 | — | — | — | — | — | — | — | — | — | — | 6.34 | |
| GiGPOBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Best2026.06 | 89.84 | — | — | — | — | — | — | — | — | — | — | 5.74 | |
| L1Backbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Avg2026.06 | 88.05 | — | — | — | — | — | — | — | — | — | — | 5.81 | |
| Meta PromptBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Best2026.06 | 87.5 | — | — | — | — | — | — | — | — | — | — | 5.64 | |
| GiGPOBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Avg2026.06 | 84.38 | — | — | — | — | — | — | — | — | — | — | 5.49 | |
| UMEM-Qwen3-4BFrozen Executor=GPT-5.1, Parameters=4B2026.02 | 82.84 | — | — | — | — | — | — | — | — | — | 84.2 | — | |
| Meta PromptBackbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Avg2026.06 | 78.48 | — | — | — | — | — | — | — | — | — | — | 4.47 | |
| MempFrozen Executor=GPT-5.1, Parameters=API2026.02 | 77.61 | — | — | — | — | — | — | — | — | — | 81.34 | — | |
| Dual-Process (AUQ)2026.01 | 74.3 | — | — | — | — | — | — | 0.968 | 0.905 | 0.791 | — | — | |
| L2Backbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Best2026.06 | 74.22 | — | — | — | — | — | — | — | — | — | — | 4.43 | |
| ReMemFrozen Executor=GPT-5.1, Parameters=API2026.02 | 73.13 | — | — | — | — | — | — | — | — | — | 79.6 | — | |
| Inverse UQ (UAR)2026.01 | 72.9 | — | — | — | — | — | — | 0.958 | 0.856 | 0.774 | — | — | |
| Self-RAGFrozen Executor=GPT-5.1, Parameters=API2026.02 | 70.9 | — | — | — | — | — | — | — | — | — | 83.71 | — | |
| Qwen3-4B-InstructFrozen Executor=GPT-5.1, Parameters=4B2026.02 | 70.9 | — | — | — | — | — | — | — | — | — | 78.86 | — | |
| CoT-SC2026.01 | 69.5 | — | — | — | — | — | — | 0.948 | 0.847 | 0.763 | — | — | |
| Reflexion2026.01 | 67.9 | — | — | — | — | — | — | 0.925 | 0.82 | 0.721 | — | — | |
| Self-Reflection2026.01 | 66.4 | — | — | — | — | — | — | 0.922 | 0.831 | 0.718 | — | — | |
| Forward UQ (UAM)2026.01 | 65.7 | — | — | — | — | — | — | 0.963 | 0.841 | 0.807 | — | — | |
| L2Backbone Model=Qwen2.5-1.5B, Metric Aggregation Type=Avg2026.06 | 65.62 | — | — | — | — | — | — | — | — | — | — | 3.63 | |
| UMEM-Llama-3.2-1BFrozen Executor=GPT-5.1, Parameters=1B2026.02 | 64.18 | — | — | — | — | — | — | — | — | — | 75.37 | — | |
| ReAct2026.01 | 63.6 | — | — | — | — | — | — | 0.913 | 0.783 | 0.667 | — | — | |
| No MemoryFrozen Executor=GPT-5.1, Parameters=-2026.02 | 61.94 | — | — | — | — | — | — | — | — | — | 66.67 | — | |
| Llama-3.2-1B-InstructFrozen Executor=GPT-5.1, Parameters=1B2026.02 | 61.94 | — | — | — | — | — | — | — | — | — | 73.63 | — | |
| UMEM-Qwen3-4BFrozen Executor=Gemini-2.5-Flash, Parameters=4B2026.02 | 61.19 | — | — | — | — | — | — | — | — | — | 78.61 | — | |
| MempFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 60.45 | — | — | — | — | — | — | — | — | — | 76.74 | — | |
| Self-RAGFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 59.7 | — | — | — | — | — | — | — | — | — | 74.5 | — | |
| UMEM-Llama-3.2-1BFrozen Executor=Gemini-2.5-Flash, Parameters=1B2026.02 | 58.96 | — | — | — | — | — | — | — | — | — | 77.24 | — | |
| ReMemFrozen Executor=Gemini-2.5-Flash, Parameters=API2026.02 | 56.72 | — | — | — | — | — | — | — | — | — | 75.62 | — | |
| No MemoryFrozen Executor=Gemini-2.5-Flash, Parameters=-2026.02 | 55.22 | — | — | — | — | — | — | — | — | — | 72.89 | — | |
| Llama-3.2-1B-InstructFrozen Executor=Gemini-2.5-Flash, Parameters=1B2026.02 | 53.73 | — | — | — | — | — | — | — | — | — | 71.27 | — | |
| Qwen3-4B-InstructFrozen Executor=Gemini-2.5-Flash, Parameters=4B2026.02 | 52.24 | — | — | — | — | — | — | — | — | — | 72.64 | — | |
| UMEM-Qwen3-4BFrozen Executor=Qwen3-8B-Thinking, Parameters=4B2026.02 | 50.75 | — | — | — | — | — | — | — | — | — | 73.13 | — | |
| Llama-3.2-1B-InstructFrozen Executor=Qwen3-8B-Thinking, Parameters=1B2026.02 | 47.01 | — | — | — | — | — | — | — | — | — | 74.13 | — | |
| ReMemFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 46.27 | — | — | — | — | — | — | — | — | — | 66.17 | — | |
| MempFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 44.78 | — | — | — | — | — | — | — | — | — | 69.78 | — | |
| UMEM-Llama-3.2-1BFrozen Executor=Qwen3-8B-Thinking, Parameters=1B2026.02 | 44.78 | — | — | — | — | — | — | — | — | — | 72.14 | — | |
| No MemoryFrozen Executor=Qwen3-8B-Thinking, Parameters=-2026.02 | 41.04 | — | — | — | — | — | — | — | — | — | 68.91 | — | |
| Qwen3-4B-InstructFrozen Executor=Qwen3-8B-Thinking, Parameters=4B2026.02 | 40.3 | — | — | — | — | — | — | — | — | — | 65.92 | — | |
| Self-RAGFrozen Executor=Qwen3-8B-Thinking, Parameters=8B2026.02 | 30.6 | — | — | — | — | — | — | — | — | — | 54.23 | — | |
| CoT-SC2026.01 | — | 0.185 | 0.224 | 0.177 | 0.215 | 0.178 | 0.206 | — | — | — | — | — | |
| Dual-Process (AUQ)module=AUQ, Best-of-N=32026.01 | — | 0.174 | 0.218 | 0.162 | 0.198 | 0.093 | 0.176 | — | — | — | — | — | |
| Forward UQ (UAM)module=UAM-only2026.01 | — | 0.109 | 0.22 | 0.16 | 0.222 | 0.104 | 0.217 | — | — | — | — | — | |
| Inverse UQ (UAR)module=UAR-only, Best-of-N=32026.01 | — | 0.205 | 0.202 | 0.207 | 0.205 | 0.131 | 0.191 | — | — | — | — | — | |
| ReAct2026.01 | — | 0.306 | 0.258 | 0.286 | 0.272 | 0.255 | 0.236 | — | — | — | — | — | |
| Reflexion2026.01 | — | 0.279 | 0.237 | 0.234 | 0.264 | 0.199 | 0.219 | — | — | — | — | — | |
| Self-Reflection2026.01 | — | 0.264 | 0.227 | 0.223 | 0.254 | 0.185 | 0.218 | — | — | — | — | — |