Embodied Task Completion on ALFWorld (All tasks)
96Overall Success RateEvolving-RL
Evaluation Results
| Method | Links | |
|---|---|---|
| Evolving-RLSkill Injection=true2026.05 | 96 | |
| Evolving-RLSkill Injection=false2026.05 | 93.1 | |
| GRPOSkill Injection=true2026.05 | 83.3 | |
| SkillRLSkill Injection=false2026.05 | 81.7 | |
| ReflActDemos=1-shot, Calls/Task=~ 10, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 80.6 | |
| GRPOSkill Injection=false2026.05 | 79.9 | |
| ReflexGradDemos=None, Calls/Task=~ 100, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 75.4 | |
| LATSDemos=1-shot, Calls/Task=~ 140, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 72.7 | |
| Tree of ThoughtsDemos=1-shot, Calls/Task=~ 100, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 69.7 | |
| Self-RefineDemos=1-shot, Calls/Task=~ 55, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 68.7 | |
| ReActDemos=1-shot, Calls/Task=~ 10, Backbone=Qwen-3-8B, Number of seeds=102025.11 | 65.7 | |
| MementoSkill Injection=false2026.05 | 53 | |
| ExpeLSkill Injection=false2026.05 | 46.3 | |
| Base ModelSkill Injection=false2026.05 | 45.5 | |
| Base ModelSkill Injection=true2026.05 | 44.5 | |
| ReasoningBankSkill Injection=false2026.05 | 41.1 |