Text-based embodied AI on ALFWorld
100Pick SuccessGRPO+OPSD
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| GRPO+OPSDBackbone=Qwen2.5-3B-Instruct2026.05 | 100 | 82.4 | 85.7 | 75 | 70 | 60 | 81.2 | |
| Skill-GRPO*Backbone=Qwen2.5-7B-Instruct, validation with skills=true2026.05 | 100 | 83.3 | 96.4 | 83.3 | 75 | 78.9 | 88.3 | |
| RLSDBackbone=Qwen2.5-7B-Instruct2026.05 | 100 | 87.5 | 92.3 | 58.8 | 80 | 65.2 | 82 | |
| SDARBackbone=Qwen2.5-3B-Instruct2026.05 | 97.1 | 62.5 | 100 | 61.9 | 75 | 84.2 | 84.4 | |
| SDARBackbone=Qwen2.5-7B-Instruct2026.05 | 94.7 | 75 | 100 | 86.7 | 68.2 | 78.9 | 85.9 | |
| Skill-GRPO*Backbone=Qwen2.5-3B-Instruct, validation with skills=true2026.05 | 94.3 | 57.1 | 100 | 66.7 | 73.1 | 57.1 | 80.5 | |
| Skill-SDBackbone=Qwen2.5-7B-Instruct2026.05 | 93.9 | 93.8 | 90.9 | 100 | 69.2 | 68.4 | 85.1 | |
| GRPO+OPSDBackbone=Qwen2.5-7B-Instruct2026.05 | 91.4 | 61.5 | 100 | 87.5 | 76.5 | 52.2 | 80.4 | |
| GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 91.2 | 62.5 | 96.2 | 61.9 | 65 | 47.4 | 75 | |
| GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 91.2 | 87.5 | 96.2 | 81 | 65 | 57.9 | 81.2 | |
| Skill-GRPOBackbone=Qwen2.5-3B-Instruct2026.05 | 88.9 | 71.4 | 58.8 | 70.6 | 40.7 | 29.2 | 60.2 | |
| Skill-GRPOBackbone=Qwen2.5-7B-Instruct2026.05 | 88.5 | 66.7 | 65.2 | 61.1 | 57.7 | 73.1 | 69.5 | |
| Skill-SDBackbone=Qwen2.5-3B-Instruct2026.05 | 88.2 | 50 | 96.2 | 52.4 | 65 | 57.9 | 73.4 | |
| RLSDBackbone=Qwen2.5-3B-Instruct2026.05 | 87.9 | 75 | 90.9 | 75 | 73.1 | 68.4 | 79.7 | |
| SDARBackbone=Qwen3-1.7B-Instruct2026.05 | 73.5 | 25 | 76.9 | 33.3 | 40 | 36.8 | 53.9 | |
| GRPOBackbone=Qwen3-1.7B-Instruct2026.05 | 71.1 | 41.7 | 36.4 | 40 | 31.8 | 31.6 | 46.1 | |
| Skill-SDBackbone=Qwen3-1.7B-Instruct2026.05 | 52.9 | 37.5 | 69.2 | 42.9 | 60 | 36.8 | 52.3 | |
| Skill-Prompt*Backbone=Qwen2.5-3B-Instruct, validation with skills=true2026.05 | 51.7 | 66.7 | 48.4 | 0 | 4.3 | 10 | 28.9 | |
| Skill-Prompt*Backbone=Qwen2.5-7B-Instruct, validation with skills=true2026.05 | 51.7 | 50 | 32.3 | 5.3 | 4.3 | 0 | 23.4 | |
| OPSDBackbone=Qwen2.5-7B-Instruct2026.05 | 50 | 60 | 22.7 | 21.4 | 17.6 | 9.5 | 32.8 | |
| RLSDBackbone=Qwen3-1.7B-Instruct2026.05 | 50 | 37.5 | 61.5 | 19 | 50 | 21.1 | 42.2 | |
| OPSDBackbone=Qwen2.5-3B-Instruct2026.05 | 48.8 | 41.7 | 16.7 | 0 | 15.8 | 16.7 | 28.1 | |
| VanillaBackbone=Qwen2.5-3B-Instruct2026.05 | 44.4 | 11.1 | 6.2 | 15.4 | 28.6 | 12.5 | 21.9 | |
| GRPO+OPSDBackbone=Qwen3-1.7B-Instruct2026.05 | 38.2 | 50 | 30.8 | 28.6 | 30 | 21.1 | 32 | |
| VanillaBackbone=Qwen2.5-7B-Instruct2026.05 | 36.1 | 22.2 | 3.1 | 0 | 0 | 0 | 12.5 | |
| Skill-GRPO*Backbone=Qwen3-1.7B-Instruct, validation with skills=true2026.05 | 31.4 | 42.9 | 51.9 | 8.3 | 11.5 | 7.1 | 28.1 | |
| Skill-GRPOBackbone=Qwen3-1.7B-Instruct2026.05 | 27.6 | 54.5 | 22.7 | 27.3 | 0 | 19.2 | 21.1 | |
| OPSDBackbone=Qwen3-1.7B-Instruct2026.05 | 26.3 | 33.3 | 9.1 | 0 | 4.5 | 5.3 | 14.1 | |
| VanillaBackbone=Qwen3-1.7B-Instruct2026.05 | 25 | 22.2 | 3.1 | 0 | 21.4 | 4.2 | 12.5 | |
| Skill-Prompt*Backbone=Qwen3-1.7B-Instruct, validation with skills=true2026.05 | 10.3 | 50 | 16.1 | 0 | 0 | 5 | 9.4 |