Science Simulation Task Completion on ScienceWorld Unseen
66.3Success RateImagine-and-Act
Evaluation Results
| Method | Links | |
|---|---|---|
| Imagine-and-ActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 66.3 | |
| ReActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 62.8 | |
| COMAPBackbone=Qwen3-8B, Category=Co-evolving, Training-based=true2026.06 | 56.95 | |
| Imagine-and-ActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 55.8 | |
| ITPRBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 55.3 | |
| IWMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 54.3 | |
| ReActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 53.4 | |
| ReAct (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 50.33 | |
| COMAPBackbone=Qwen3-4B, Category=Co-evolving, Training-based=true2026.06 | 49.2 | |
| Imagine-and-ActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 48.6 | |
| WKMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 47.68 | |
| ReActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 45.3 | |
| ITPRBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 43.2 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 42.14 | |
| IWMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 40.6 | |
| WKMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 37.5 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 36.7 | |
| ReAct (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 34.2 | |
| RAPBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 27.14 | |
| ITPIBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 19.2 | |
| Imagine-and-ActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 15.6 | |
| ITPIBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 14.2 | |
| RAPBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 12.5 | |
| ReflexionBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 12.1 | |
| ReActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 8.61 | |
| ReflexionBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 8.4 | |
| Imagine-and-ActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 7.9 | |
| ReActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 5.44 |