Decision-making in interactive environments on ScienceWorld (OOD)
34.36PerformanceGlider
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| GliderTraining Type=Fine-Tuning-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 34.36 | 20,939.88 | 10.838 | |
| Multi2Training Type=Fine-Tuning-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 30.68 | 14,716.87 | 13.769 | |
| ADaPTTraining Type=Prompt-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 12.27 | 63,288.85 | 1.281 | |
| ReActTraining Type=Prompt-Based, Structure Type=Single, Backbone=Llama-3.1 8B2026.06 | 10.3 | 68,031.35 | 1 | |
| ReflexionTraining Type=Prompt-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 6.97 | 64,755.37 | 0.711 | |
| GRPOTraining Type=Fine-Tuning-Based, Structure Type=Single, Backbone=Llama-3.1 8B2026.06 | 4.61 | 9,878 | 3.083 |