Text-based embodied task on Sciworld
77.77Success RateQwen2.5-Actor
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| Qwen2.5-ActorActor=Qwen2.5-Actor, Thinker=No2026.05 | 77.77 | 83.07 | |
| Qwen2.5-ActorActor=Qwen2.5-Actor, Thinker=Exp-Thinker2026.05 | 74.44 | 82.27 | |
| Qwen2.5-72BActor=Qwen2.5-72B, Thinker=No2026.05 | 68.88 | 76.74 | |
| Qwen2.5-7BActor=Qwen2.5-7B, Thinker=Exp-Thinker2026.05 | 65.55 | 72.69 | |
| LLaMA3-ActorActor=LLaMA3-Actor, Thinker=Exp-Thinker2026.05 | 51.11 | 63.14 | |
| LLaMA3-ActorActor=LLaMA3-Actor, Thinker=No2026.05 | 45.56 | 54.87 | |
| LLaMA3-8BActor=LLaMA3-8B, Thinker=Exp-Thinker2026.05 | 44.44 | 55.43 | |
| GPT-4oActor=GPT-4o, Thinker=No2026.05 | 40 | 76.9 | |
| Qwen2.5-7BActor=Qwen2.5-7B, Thinker=No2026.05 | 33.33 | 39.82 | |
| AgentGymActor=AgentGym, Thinker=No2026.05 | 18.9 | 47.5 | |
| AgentRefineActor=AgentRefine, Thinker=No2026.05 | 14.4 | 42.6 | |
| LLaMA3-8BActor=LLaMA3-8B, Thinker=No2026.05 | 13.33 | 20.31 | |
| Agent-FLANActor=Agent-FLAN, Thinker=No2026.05 | 1.1 | 10.9 |