Embodied Decision-making on ALFWorld (ID and OOD)
92.86Success RateRL w/ ACT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| RL w/ ACTBackbone=Qwen3-8B2026.03 | 92.86 | — | — | — | |
| IL w/ ACTBackbone=Qwen3-8B2026.03 | 91.43 | — | — | — | |
| RLBackbone=Qwen3-8B2026.03 | 90.71 | — | — | — | |
| RL w/ ACTBackbone=Qwen3-8B2026.03 | 88.06 | — | — | — | |
| Early Experience (Self-Reflection)Backbone=Qwen3-8B2026.03 | 87.86 | — | — | — | |
| IL w/ ACTBackbone=Qwen3-8B2026.03 | 87.31 | — | — | — | |
| Early Experience (Self-Reflection)Backbone=Qwen3-8B2026.03 | 85.82 | — | — | — | |
| Imitation LearningBackbone=Qwen3-8B2026.03 | 85.71 | — | — | — | |
| RLBackbone=Qwen3-8B2026.03 | 84.33 | — | — | — | |
| Imitation LearningBackbone=Qwen3-8B2026.03 | 82.84 | — | — | — | |
| ACTBackbone=Qwen3-8B2026.03 | 72.86 | — | — | — | |
| ACTBackbone=Qwen3-8B2026.03 | 72.39 | — | — | — | |
| Prompt w/ CoT thinkingBackbone=Qwen3-8B, CoT=true2026.03 | 56.43 | — | — | — | |
| Prompt w/ CoT thinkingBackbone=Qwen3-8B, CoT=true2026.03 | 50 | — | — | — | |
| Prompt w/o CoT thinkingBackbone=Qwen3-8B, CoT=false2026.03 | 35.71 | — | — | — | |
| Prompt w/o CoT thinkingBackbone=Qwen3-8B, CoT=false2026.03 | 27.61 | — | — | — | |
| Imitation LearningTraining Paradigm=Learning from experts/strong LLMs2026.02 | — | 84.9 | 77.6 | 82.5 | |
| IWMTraining Paradigm=Learning from experts/strong LLMs2026.02 | — | 85.6 | 78.1 | 83.1 | |
| RWML + Policy RLTraining Paradigm=Self-Supervised + Policy RL2026.02 | — | 86.7 | 90.1 | 87.9 | |
| SRTraining Paradigm=Learning from experts/strong LLMs2026.02 | — | 83.9 | 82.3 | 83.3 | |
| WM SFT + Policy RLTraining Paradigm=Self-Supervised + Policy RL2026.02 | — | 76.2 | 82.3 | 80.4 |