Interactive Reasoning on ALFWorld
47.9Average Reasoning Length (tokens)KD (1.3B)
Evaluation Results
| Method | Links | |
|---|---|---|
| KD (1.3B)Distillation Method=KD, Model Family=OPT, Model Size=1.3B, Teacher Model=OPT-13B2025.05 | 47.9 | |
| SeqKD (1.3B)Distillation Method=SeqKD, Model Family=OPT, Model Size=1.3B, Teacher Model=OPT-13B2025.05 | 46.8 | |
| Token-level-1.3BDistillation Method=Token-level, Model Family=OPT, Model Size=1.3B, Teacher Model=OPT-13B2025.05 | 45.7 | |
| KD (2.7B)Distillation Method=KD, Model Family=OPT, Model Size=2.7B, Teacher Model=OPT-13B2025.05 | 44.3 | |
| SeqKD (2.7B)Distillation Method=SeqKD, Model Family=OPT, Model Size=2.7B, Teacher Model=OPT-13B2025.05 | 43.2 | |
| KD (7B)Distillation Method=KD, Model Family=LLaMA, Model Size=7B, Teacher Model=LLaMA-13B2025.05 | 43 | |
| KD (6.7B)Distillation Method=KD, Model Family=OPT, Model Size=6.7B, Teacher Model=OPT-13B2025.05 | 42.6 | |
| Token-level-2.7BDistillation Method=Token-level, Model Family=OPT, Model Size=2.7B, Teacher Model=OPT-13B2025.05 | 42.5 | |
| SeqKD (7B)Distillation Method=SeqKD, Model Family=LLaMA, Model Size=7B, Teacher Model=LLaMA-13B2025.05 | 42 | |
| SeqKD (6.7B)Distillation Method=SeqKD, Model Family=OPT, Model Size=6.7B, Teacher Model=OPT-13B2025.05 | 41.7 | |
| Ours (OPT-1.3B)Distillation Method=Structured Agent Distillation, Model Family=OPT, Model Size=1.3B, Teacher Model=OPT-13B2025.05 | 41.2 | |
| Token-level-7BDistillation Method=Token-level, Model Family=LLaMA, Model Size=7B, Teacher Model=LLaMA-13B2025.05 | 41.1 | |
| Token-level-OPT-6.7BDistillation Method=Token-level, Model Family=OPT, Model Size=6.7B, Teacher Model=OPT-13B2025.05 | 40.8 | |
| Ours (OPT-2.7B)Distillation Method=Structured Agent Distillation, Model Family=OPT, Model Size=2.7B, Teacher Model=OPT-13B2025.05 | 39.4 | |
| Teacher (OPT-13B)Distillation Method=None, Model Family=OPT, Model Size=13B, Teacher Model=N/A2025.05 | 38.2 | |
| Ours (LLaMA-7B)Distillation Method=Structured Agent Distillation, Model Family=LLaMA, Model Size=7B, Teacher Model=LLaMA-13B2025.05 | 38.2 | |
| Ours (OPT-6.7B)Distillation Method=Structured Agent Distillation, Model Family=OPT, Model Size=6.7B, Teacher Model=OPT-13B2025.05 | 38 | |
| Teacher (LLaMA-13B)Distillation Method=None, Model Family=LLaMA, Model Size=13B, Teacher Model=N/A2025.05 | 37.5 |