Interactive Decision Making on ALFWorld (qualitative context)
99Success Rate (SR)RAFA
Evaluation Results
| Method | Links | |
|---|---|---|
| RAFABackbone / Agent=GPT-4, Regime=Prompt-only (iterative replanning), Trials=8 iter.2026.03 | 99 | |
| RPMSBackbone / Agent=Claude Sonnet 4.5, Regime=Prompt-only (rule+mem), Trials=single-run2026.03 | 98.5 | |
| ReflexionBackbone / Agent=GPT-3.5, Regime=Prompt-only (iterative reflection), Trials=11 iter.2026.03 | 97 | |
| RPMSBackbone / Agent=Llama-3.1-70B, Regime=Prompt-only (rule+mem), Trials=single-run2026.03 | 88.1 | |
| A3TBackbone / Agent=Trained (self-training), Regime=Trained, Trials=single-run2026.03 | 86 | |
| ReActBackbone / Agent=PaLM-540B / text-davinci-002, Regime=Prompt-only, Trials=single-run2026.03 | 70.9 | |
| RPMSBackbone / Agent=Llama-3.1-8B, Regime=Prompt-only (rule+mem), Trials=single-run2026.03 | 59.7 | |
| BUTLER8Backbone / Agent=Trained policy (IL / seq2seq), Regime=Trained, Trials=best-of-82026.03 | 37 |