Cross-benchmark aggregate ranking on ScienceWorld, τ-Bench, and PlanCraft
1.6Aggregate RankProPlay
Evaluation Results
| Method | Links | |
|---|---|---|
| ProPlayBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 1.6 | |
| ReflexionBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 3.1 | |
| ExpeLBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 3.3 | |
| Wall-EBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 4.4 | |
| LATSBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 4.8 | |
| ReActBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 5.3 | |
| WorldCoderBackbone LLM=GPT-4.1-mini, Temperature=0, Inference setting=Online2026.06 | 5.4 |