Embodied Task Planning on ALFWorld visual observation
77.6Avg Success RateRoboAgent
Evaluation Results
| Method | Links | |||||||
|---|---|---|---|---|---|---|---|---|
| RoboAgentBase Model=Qwen2.5-VL-3B2026.04 | 77.6 | 92 | 84 | 74 | 57 | 94 | 59 | |
| SEEA-R1Base Model=Qwen2.5-VL-7B2026.04 | 36 | 49 | 40 | 43 | 41 | 24 | 16 | |
| TCPOBase Model=LLaVA1.6-mistral-7b2026.04 | 26.7 | 27 | 25 | 29 | 6 | 33 | 42 | |
| CoSoBase Model=LLaVA1.6-mistral-7b2026.04 | 26.5 | 42 | 21 | 12 | 22 | 21 | 26 | |
| GFlowVLMBase Model=LLaVA1.6-mistral-7b2026.04 | 26.1 | 50 | 10 | 19 | 24 | 23 | 24 | |
| GPT-4oBase Model=GPT-4o, Evaluation Protocol=Zero-Shot2026.04 | 24 | 44 | 22 | 29 | 27 | 7 | 23 | |
| RL4VLMBase Model=LLaVA1.6-mistral-7b2026.04 | 21.7 | 47 | 10 | 14 | 19 | 15 | 18 | |
| GPT-4VBase Model=GPT-4V, Evaluation Protocol=Zero-Shot2026.04 | 19.4 | 38 | 18 | 6.7 | 18 | 12 | 15 | |
| GTRBase Model=LLaVA1.6-mistral-7b2026.04 | 17 | 37 | 7 | 8 | 33 | 23 | 20 | |
| GeminiBase Model=Gemini, Evaluation Protocol=Zero-Shot2026.04 | 13.5 | 35 | 0 | 0 | 0 | 16 | 12 |