Interactive Instruction Following on ALFWorld Unseen
86.68Success RateCOMAP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| COMAPBackbone=Qwen3-8B, Category=Co-evolving, Training-based=true2026.06 | 86.68 | — | |
| Imagine-and-ActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 84.7 | — | |
| Imagine-and-ActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 83.9 | — | |
| ITPRBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 83.2 | — | |
| ReActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 80.6 | — | |
| ReActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 80.2 | — | |
| IWMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 79.5 | — | |
| Entropy-Aware OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 79.1 | 16.75 | |
| WKMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 76.87 | — | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 74.85 | 17.16 | |
| SAGE-OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 73.88 | 17.57 | |
| TCOD-F2BStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 73.13 | 17.87 | |
| OPD (rollout 2)Student Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 72.39 | 18.37 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 72.34 | — | |
| SAGE-OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 70.9 | 17.98 | |
| COMAPBackbone=Qwen3-4B, Category=Co-evolving, Training-based=true2026.06 | 70.68 | — | |
| OPD (rollout 2)Student Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 70.37 | 18.21 | |
| SAGE-OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 70.15 | 17.86 | |
| BaseTeacher Model=Qwen3-32B2026.06 | 69.4 | 18.21 | |
| OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 68.66 | 18.65 | |
| Imagine-and-ActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 68.3 | — | |
| Entropy-Aware OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 68.13 | 18.28 | |
| TCOD-F2BStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 67.91 | 19.26 | |
| BaseTeacher Model=Qwen3-8B2026.06 | 67.16 | 17.24 | |
| Entropy-Aware OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 65.67 | 18.2 | |
| OPD (rollout 2)Student Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 64.93 | 17.87 | |
| ReActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 64.5 | — | |
| SAGE-OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 61.94 | 18.89 | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 61.94 | 17.67 | |
| TCOD-F2BStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 61.19 | 18.82 | |
| OPD (rollout 2)Student Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 59.7 | 20.31 | |
| TCOD-F2BStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 58.21 | 19.16 | |
| ReAct (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 57.62 | — | |
| OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 56.72 | 20.3 | |
| Entropy-Aware OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 54.48 | 20.75 | |
| ITPRBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 48.54 | — | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 48.4 | — | |
| IWMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 47.2 | — | |
| ReAct (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 45.8 | — | |
| WKMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 44.9 | — | |
| ITPIBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 39.2 | — | |
| Imagine-and-ActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 30.55 | — | |
| ITPIBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 28.7 | — | |
| RAPBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 26.8 | — | |
| BaseStudent Model=Qwen3-1.7B2026.06 | 26.12 | 24.72 | |
| SFTStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 26.12 | 24.54 | |
| ReflexionBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 22.4 | — | |
| RAPBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 22.1 | — | |
| ReflexionBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 19.2 | — | |
| Imagine-and-ActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 18.2 | — | |
| ReActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 17.85 | — | |
| ReActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 12.5 | — | |
| SFTStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 4.48 | 28.87 | |
| BaseStudent Model=Qwen3-0.6B2026.06 | 0.75 | 29.82 |