Decision Making on AlfWorld
6.4StepsTeacher (LLaMA-13B)
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| Teacher (LLaMA-13B)Backbone=LLaMA, Model Size=13B2025.05 | 6.4 | — | — | — | |
| Structured Agent DistillationBackbone=LLaMA, Model Size=7B2025.05 | 6.4 | — | — | — | |
| Teacher (OPT-13B)Backbone=OPT, Model Size=13B2025.05 | 6.5 | — | — | — | |
| Structured Agent DistillationBackbone=OPT, Model Size=6.7B2025.05 | 6.5 | — | — | — | |
| Structured Agent DistillationBackbone=OPT, Model Size=2.7B2025.05 | 6.7 | — | — | — | |
| Token-levelBackbone=LLaMA, Model Size=7B2025.05 | 6.7 | — | — | — | |
| Token-levelBackbone=OPT, Model Size=6.7B2025.05 | 6.8 | — | — | — | |
| SeqKDBackbone=LLaMA, Model Size=7B2025.05 | 6.9 | — | — | — | |
| Structured Agent DistillationBackbone=OPT, Model Size=1.3B2025.05 | 7 | — | — | — | |
| SeqKDBackbone=OPT, Model Size=6.7B2025.05 | 7 | — | — | — | |
| KDBackbone=LLaMA, Model Size=7B2025.05 | 7.1 | — | — | — | |
| Token-levelBackbone=OPT, Model Size=2.7B2025.05 | 7.2 | — | — | — | |
| KDBackbone=OPT, Model Size=6.7B2025.05 | 7.2 | — | — | — | |
| SeqKDBackbone=OPT, Model Size=2.7B2025.05 | 7.5 | — | — | — | |
| Token-levelBackbone=OPT, Model Size=1.3B2025.05 | 7.8 | — | — | — | |
| KDBackbone=OPT, Model Size=2.7B2025.05 | 7.8 | — | — | — | |
| SeqKDBackbone=OPT, Model Size=1.3B2025.05 | 8 | — | — | — | |
| KDBackbone=OPT, Model Size=1.3B2025.05 | 8.3 | — | — | — | |
| AutoRefineBackbone=GPT-4-turbo2026.01 | 12.8 | — | — | 98.4 | |
| ReActBackbone=GPT-4-turbo2026.01 | 14 | — | — | 91 | |
| ReflexionBackbone=GPT-4-turbo2026.01 | 15.7 | — | — | 95.5 | |
| ReAct + ReflexionBackbone=GPT-4-turbo2026.01 | 16.1 | — | — | 95.5 | |
| ChatGPT 3.5-turboModel=3.5-turbo2024.12 | — | 7.5 | 5.2 | 76.5 | |
| ChatGPT 4oModel=4o2024.12 | — | 14.2 | 20.9 | 76.6 | |
| ChatGPT o1-miniModel=o1-mini2024.12 | — | 1.5 | 8.2 | 92.3 |