Text-based embodied task on PDDL
61.7Success RateGPT-4o
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| GPT-4oActor=GPT-4o, Thinker=No2026.05 | 61.7 | 69.8 | |
| Qwen2.5-72BActor=Qwen2.5-72B, Thinker=No2026.05 | 56.66 | 70.5 | |
| Qwen2.5-7BActor=Qwen2.5-7B, Thinker=No2026.05 | 18.33 | 25.38 | |
| LLaMA3-8BActor=LLaMA3-8B, Thinker=Exp-Thinker2026.05 | 16.66 | 30.06 | |
| AgentRefineActor=AgentRefine, Thinker=No2026.05 | 16.6 | 37.8 | |
| Qwen2.5-ActorActor=Qwen2.5-Actor, Thinker=No2026.05 | 15 | 29.76 | |
| Qwen2.5-ActorActor=Qwen2.5-Actor, Thinker=Exp-Thinker2026.05 | 11.66 | 31.43 | |
| LLaMA3-8BActor=LLaMA3-8B, Thinker=No2026.05 | 10 | 29.94 | |
| LLaMA3-ActorActor=LLaMA3-Actor, Thinker=Exp-Thinker2026.05 | 10 | 32.11 | |
| Qwen2.5-7BActor=Qwen2.5-7B, Thinker=Exp-Thinker2026.05 | 8.33 | 20.87 | |
| Agent-FLANActor=Agent-FLAN, Thinker=No2026.05 | 8.3 | 25.5 | |
| LLaMA3-ActorActor=LLaMA3-Actor, Thinker=No2026.05 | 5 | 20.19 | |
| AgentGymActor=AgentGym, Thinker=No2026.05 | 1.7 | 16.6 |