Interactive environment reasoning and problem-solving on ScienceWorld
70.2Average ScoreProPlay
Evaluation Results
| Method | Links | ||
|---|---|---|---|
| ProPlayBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 70.2 | 37.4 | |
| ExpeLBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 67.9 | 36.3 | |
| ReActBackbone=GPT-42026.07 | 66.16 | — | |
| ReflexionBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 65 | 32.2 | |
| ReActBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 58.7 | 27 | |
| ATGBackbone=Llama-3-8B2026.07 | 56.79 | — | |
| WorldCoderBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 53.4 | 24.8 | |
| Wall-EBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 52.3 | 24.8 | |
| ATGBackbone=Gemma-7B2026.07 | 52.03 | — | |
| ATGBackbone=Mistral-7B2026.07 | 49.81 | — | |
| LATSBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online, Trials per task=12026.06 | 48.1 | 18.9 | |
| PoGBackbone=Llama-3-8B2026.07 | 35.72 | — | |
| ToTBackbone=Llama-3-8B2026.07 | 31.25 | — | |
| PoGBackbone=Mistral-7B2026.07 | 28.63 | — | |
| CAMELBackbone=Llama-3-8B2026.07 | 28.1 | — | |
| ReflexionBackbone=Llama-3-8B2026.07 | 26.28 | — | |
| ToTBackbone=Mistral-7B2026.07 | 25.44 | — | |
| ReActBackbone=Llama-3-8B2026.07 | 23.67 | — | |
| CAMELBackbone=Mistral-7B2026.07 | 22.37 | — | |
| ReflexionBackbone=Mistral-7B2026.07 | 19.53 | — | |
| ReActBackbone=Mistral-7B2026.07 | 19.12 | — | |
| ReActBackbone=GPT-3.5-Turbo2026.07 | 14.67 | — | |
| PoGBackbone=Gemma-7B2026.07 | 13.85 | — | |
| ToTBackbone=Gemma-7B2026.07 | 11.32 | — | |
| CAMELBackbone=Gemma-7B2026.07 | 7.92 | — | |
| ReflexionBackbone=Gemma-7B2026.07 | 4.41 | — | |
| ReActBackbone=Gemma-7B2026.07 | 3.54 | — |