Embodied Task Completion on ALFWorld in-distribution held-out (test)
96.09Success RateSkillFlow
Evaluation Results
| Method | Links | |||||
|---|---|---|---|---|---|---|
| SkillFlowMethod Category=Ours2026.05 | 96.09 | — | — | — | — | |
| SkillRLMethod Category=Agent+RL2026.05 | 85.16 | — | — | — | — | |
| FlowSteerMethod Category=Agent+RL2026.05 | 82.81 | — | — | — | — | |
| AgentFlowMethod Category=Agent+RL2026.05 | 80.47 | — | — | — | — | |
| Qwen3.5-AFlowMethod Category=AFlow, Backbone=Qwen3.52026.05 | 75 | — | — | — | — | |
| v4-flashMethod Category=Baseline2026.05 | 61.21 | — | — | — | — | |
| Qwen3.5-GRPOMethod Category=GRPO, Backbone=Qwen3.52026.05 | 50.78 | — | — | — | — | |
| Qwen3.5-9BMethod Category=Baseline2026.05 | 48.28 | — | — | — | — | |
| Qwen3.5-SFTMethod Category=SFT, Backbone=Qwen3.52026.05 | 40.52 | — | — | — | — | |
| Meta-RLFramework=LAMER, Training Mode=Meta Reinforcement Learning2025.12 | — | 97.7 | 100 | 90.2 | 89.5 | |
| PromptingType=Prompting-based2025.12 | — | 91.9 | 52.9 | 48.4 | 44.8 | |
| RLFramework=LAMER, Training Mode=Reinforcement Learning2025.12 | — | 95.5 | 83 | 67.9 | 86.6 |