Sequential Decision Making on HotPotQA
4.7Average Steps per EpisodeTeacher (LLaMA-13B)
Evaluation Results
| Method | Links | |
|---|---|---|
| Teacher (LLaMA-13B)Backbone=LLaMA, Model Size=13B2025.05 | 4.7 | |
| Teacher (OPT-13B)Backbone=OPT, Model Size=13B2025.05 | 4.8 | |
| Structured Agent DistillationBackbone=LLaMA, Model Size=7B2025.05 | 4.8 | |
| Structured Agent DistillationBackbone=OPT, Model Size=6.7B2025.05 | 4.9 | |
| Structured Agent DistillationBackbone=OPT, Model Size=2.7B2025.05 | 5 | |
| Token-levelBackbone=LLaMA, Model Size=7B2025.05 | 5.2 | |
| Structured Agent DistillationBackbone=OPT, Model Size=1.3B2025.05 | 5.3 | |
| Token-levelBackbone=OPT, Model Size=6.7B2025.05 | 5.3 | |
| SeqKDBackbone=LLaMA, Model Size=7B2025.05 | 5.5 | |
| Token-levelBackbone=OPT, Model Size=2.7B2025.05 | 5.6 | |
| SeqKDBackbone=OPT, Model Size=6.7B2025.05 | 5.6 | |
| KDBackbone=OPT, Model Size=6.7B2025.05 | 5.7 | |
| KDBackbone=LLaMA, Model Size=7B2025.05 | 5.7 | |
| SeqKDBackbone=OPT, Model Size=2.7B2025.05 | 5.9 | |
| Token-levelBackbone=OPT, Model Size=1.3B2025.05 | 6 | |
| KDBackbone=OPT, Model Size=2.7B2025.05 | 6.1 | |
| SeqKDBackbone=OPT, Model Size=1.3B2025.05 | 6.2 | |
| KDBackbone=OPT, Model Size=1.3B2025.05 | 6.5 |