Instruction Following on ALFWorld (val seen)
88.57Success Rate (SR)COMAP
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| COMAPBackbone=Qwen3-8B, Category=Co-evolving, Training-based=true2026.06 | 88.57 | — | |
| Imagine-and-ActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 86.9 | — | |
| TCOD (B2F)Student Model=Qwen2.5-7B2026.04 | 86.43 | 11.06 | |
| Imagine-and-ActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 86.1 | — | |
| Qwen2.5-7B-RL (Teacher)Model Type=Teacher, Role=Oracle/Upper Bound2026.04 | 85.71 | 10.61 | |
| ITPRBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 85.71 | — | |
| ReActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 83.2 | — | |
| ReActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 82.4 | — | |
| TCOD (F2B)Student Model=Qwen2.5-7B2026.04 | 82.14 | 13.22 | |
| IWMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 82.14 | — | |
| TCOD (F2B)Student Model=Qwen2.5-3B2026.04 | 81.43 | 11.76 | |
| WKMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 79.29 | — | |
| TCOD (B2F)Student Model=Qwen2.5-3B2026.04 | 77.86 | 12.57 | |
| Vanilla OPDStudent Model=Qwen2.5-7B2026.04 | 75.37 | 13.18 | |
| COMAPBackbone=Qwen3-4B, Category=Co-evolving, Training-based=true2026.06 | 71.53 | — | |
| Imagine-and-ActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 71.2 | — | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 68.14 | — | |
| ReAct (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 67.86 | — | |
| ReActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 67.8 | — | |
| ITPRBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 67.15 | — | |
| Vanilla OPDStudent Model=Qwen2.5-3B2026.04 | 65.72 | 14.73 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 65.71 | — | |
| IWMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 64.29 | — | |
| TCOD-F2BStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 64.29 | 17.65 | |
| SAGE-OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 64.29 | 18.14 | |
| Entropy-Aware OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 63.57 | 17.28 | |
| OPD (rollout 2)Student Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 63 | 17.51 | |
| ReAct (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 62.86 | — | |
| SAGE-OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 62.82 | 18.75 | |
| WKMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 62.14 | — | |
| OPD (rollout 2)Student Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 62.14 | 18.17 | |
| BaseTeacher Model=Qwen3-8B2026.06 | 61.43 | 17.95 | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 60 | 17.8 | |
| Entropy-Aware OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 60 | 18.8 | |
| OPDStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 58.57 | 18.89 | |
| SAGE-OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 57.86 | 18.46 | |
| BaseTeacher Model=Qwen3-32B2026.06 | 57.14 | 18.94 | |
| TCOD-F2BStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-32B2026.06 | 57.14 | 19.42 | |
| OPD (rollout 2)Student Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 56.43 | 18.76 | |
| TCOD-F2BStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 56.43 | 18.51 | |
| OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 55 | 18.53 | |
| SFTStudent Model=Qwen2.5-7B2026.04 | 54.29 | 18.92 | |
| TCOD-F2BStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 54.29 | 20.18 | |
| SAGE-OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 54.29 | 19.85 | |
| Entropy-Aware OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 54.26 | 18.12 | |
| OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 53.57 | 19.49 | |
| OPD (rollout 2)Student Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 52.14 | 20.28 | |
| Entropy-Aware OPDStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-32B2026.06 | 48.57 | 20.87 | |
| ITPIBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 41.43 | — | |
| Imagine-and-ActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 32.86 | — | |
| SFTStudent Model=Qwen2.5-3B2026.04 | 32.14 | 22.85 | |
| ITPIBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 31.43 | — | |
| RAPBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 28.57 | — | |
| BaseStudent Model=Qwen3-1.7B2026.06 | 25.71 | 24.63 | |
| SFTStudent Model=Qwen3-1.7B, Teacher Model=Qwen3-8B2026.06 | 25 | 24.58 | |
| RAPBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 24.29 | — | |
| ReflexionBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 24.29 | — | |
| ReflexionBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 21.43 | — | |
| Imagine-and-ActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 20 | — | |
| ReActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 19.29 | — | |
| ReActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 14.29 | — | |
| Zero-ShotStudent Model=Qwen2.5-7B2026.04 | 9.29 | 28.34 | |
| Zero-ShotStudent Model=Qwen2.5-3B2026.04 | 7.86 | 28.73 | |
| SFTStudent Model=Qwen3-0.6B, Teacher Model=Qwen3-8B2026.06 | 2.86 | 29.32 | |
| BaseStudent Model=Qwen3-0.6B2026.06 | 1.43 | 29.65 |