Embodied AI Reasoning on ALFWorld
100CoT Match RateOPT-13B
Evaluation Results
| Method | Links | |
|---|---|---|
| OPT-13BRole=Teacher2025.05 | 100 | |
| LLaMA-13BRole=Teacher2025.05 | 100 | |
| Structured Agent DistillationTeacher Model=LLaMA-13B, Student Model=LLaMA-7B2025.05 | 77.2 | |
| Structured Agent DistillationTeacher Model=OPT-13B, Student Model=OPT-6.7B2025.05 | 76.4 | |
| Token-levelTeacher Model=LLaMA-13B, Student Model=LLaMA-7B2025.05 | 73 | |
| Token-levelTeacher Model=OPT-13B, Student Model=OPT-6.7B2025.05 | 72.2 | |
| Structured Agent DistillationTeacher Model=OPT-13B, Student Model=OPT-2.7B2025.05 | 71.6 | |
| SeqKDTeacher Model=LLaMA-13B, Student Model=LLaMA-7B2025.05 | 70.1 | |
| SeqKDTeacher Model=OPT-13B, Student Model=OPT-6.7B2025.05 | 68.7 | |
| KDTeacher Model=LLaMA-13B, Student Model=LLaMA-7B2025.05 | 68.3 | |
| Token-levelTeacher Model=OPT-13B, Student Model=OPT-2.7B2025.05 | 67.3 | |
| Structured Agent DistillationTeacher Model=OPT-13B, Student Model=OPT-1.3B2025.05 | 67.2 | |
| KDTeacher Model=OPT-13B, Student Model=OPT-6.7B2025.05 | 66.4 | |
| SeqKDTeacher Model=OPT-13B, Student Model=OPT-2.7B2025.05 | 63.4 | |
| Token-levelTeacher Model=OPT-13B, Student Model=OPT-1.3B2025.05 | 61.5 | |
| KDTeacher Model=OPT-13B, Student Model=OPT-2.7B2025.05 | 61.5 | |
| SeqKDTeacher Model=OPT-13B, Student Model=OPT-1.3B2025.05 | 58 | |
| KDTeacher Model=OPT-13B, Student Model=OPT-1.3B2025.05 | 56.2 |