Embodied household tasks on ALFWorld Unseen
89.6Average Accumulated RewardQ-Evolve
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Q-EvolveBackbone=Llama-2-7B-Chat2026.06 | 89.6 | — | |
| QLASSBackbone=Llama-2-7B-Chat2026.06 | 82.8 | — | |
| SkillRerankerBackbone Model=DeepSeek-v4-Flash2026.07 | 78.73 | 17.08 | |
| SkillRerankerBackbone Model=Qwen3.6-27B2026.07 | 73.88 | 12.8 | |
| SkillRouterBackbone Model=DeepSeek-v4-Flash2026.07 | 73.14 | 18.1 | |
| ETOBackbone=Llama-2-7B-Chat2026.06 | 72.4 | — | |
| SkillRouterBackbone Model=Qwen3.6-27B2026.07 | 72.39 | 13.6 | |
| SkillRerankerBackbone Model=GPT-5.4-Mini2026.07 | 70.9 | 17.06 | |
| LLM-as-selectorBackbone Model=DeepSeek-v4-Flash2026.07 | 70.52 | 18.61 | |
| Graph of SkillsBackbone Model=DeepSeek-v4-Flash2026.07 | 69.78 | 18.29 | |
| Best-of-NBackbone=Llama-2-7B-Chat, N=62026.06 | 69.4 | — | |
| Graph of SkillsBackbone Model=Qwen3.6-27B2026.07 | 68.66 | 13.82 | |
| SkillRouterBackbone Model=GPT-5.4-Mini2026.07 | 67.91 | 17.69 | |
| SFTBackbone=Llama-2-7B-Chat2026.06 | 67.2 | — | |
| LLM-as-selectorBackbone Model=Qwen3.6-27B2026.07 | 67.17 | 14.02 | |
| RFTBackbone=Llama-2-7B-Chat2026.06 | 66.4 | — | |
| Graph of SkillsBackbone Model=GPT-5.4-Mini2026.07 | 64.93 | 18.65 | |
| ReflexionPrompting=ReAct2026.06 | 55.2 | — | |
| LLM-as-selectorBackbone Model=GPT-5.4-Mini2026.07 | 54.85 | 19.17 | |
| GPT-4Prompting=ReAct2026.06 | 38.1 | — | |
| PPOBackbone=Llama-2-7B-Chat2026.06 | 29.1 | — | |
| GPT-3.5-TurboPrompting=ReAct2026.06 | 10.5 | — | |
| Base AgentBackbone=Llama-2-7B-Chat2026.06 | 0 | — |