Decision-making in interactive environments on ScienceWorld Llama-3.1 8B backbone (ID)
67.61PerformanceMulti2
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| Multi2Training Type=Fine-Tuning-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 67.61 | 12,315.42 | 4.483 | |
| GliderTraining Type=Fine-Tuning-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 60.48 | 14,716.87 | 3.356 | |
| GRPOTraining Type=Fine-Tuning-Based, Structure Type=Single, Backbone=Llama-3.1 8B2026.06 | 33.2 | 11,145.44 | 2.433 | |
| ADaPTTraining Type=Prompt-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 26.2 | 32,449.12 | 0.659 | |
| ReActTraining Type=Prompt-Based, Structure Type=Single, Backbone=Llama-3.1 8B2026.06 | 23.23 | 18,971.23 | 1 | |
| ReflexionTraining Type=Prompt-Based, Structure Type=Hierarchical, Backbone=Llama-3.1 8B2026.06 | 22.18 | 18,063.16 | 1.003 |