Science Simulation Task Completion on ScienceWorld Seen
69.8Success RateImagine-and-Act
Evaluation Results
| Method | Links | |
|---|---|---|
| Imagine-and-ActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 69.8 | |
| ReActBackbone=DeepSeek-V4-Pro, Category=API-Called Models, Training-free=true2026.06 | 66.5 | |
| COMAPBackbone=Qwen3-8B, Category=Co-evolving, Training-based=true2026.06 | 61.85 | |
| Imagine-and-ActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 60.7 | |
| WKMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 60.31 | |
| ITPRBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 60.2 | |
| IWMBackbone=Qwen3-8B, Category=World Modeling, Training-free=true2026.06 | 59.27 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 58.62 | |
| ReActBackbone=GPT-5.4, Category=API-Called Models, Training-free=true2026.06 | 58.1 | |
| ReAct (w/ SFT)Backbone=Qwen3-8B, Category=Base Agent Planning, Training-based=true2026.06 | 57.21 | |
| COMAPBackbone=Qwen3-4B, Category=Co-evolving, Training-based=true2026.06 | 53.9 | |
| Imagine-and-ActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 52.7 | |
| ITPRBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 49.85 | |
| ReActBackbone=DeepSeek-V4-Flash, Category=API-Called Models, Training-free=true2026.06 | 49.6 | |
| IWMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 45.2 | |
| WKMBackbone=Qwen3-4B, Category=World Modeling, Training-free=true2026.06 | 43.7 | |
| Imagine-and-Act (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 42.3 | |
| ReAct (w/ SFT)Backbone=Qwen3-4B, Category=Base Agent Planning, Training-based=true2026.06 | 39.5 | |
| ITPIBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 19.58 | |
| Imagine-and-ActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 16.8 | |
| RAPBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 15.46 | |
| ITPIBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 13.6 | |
| ReflexionBackbone=Qwen3-8B, Category=Test-time Evolving, Training-free=true2026.06 | 12.5 | |
| RAPBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 10.8 | |
| ReActBackbone=Qwen3-8B, Category=Base Agent Planning, Training-free=true2026.06 | 9.79 | |
| ReflexionBackbone=Qwen3-4B, Category=Test-time Evolving, Training-free=true2026.06 | 8.9 | |
| Imagine-and-ActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 8.6 | |
| ReActBackbone=Qwen3-4B, Category=Base Agent Planning, Training-free=true2026.06 | 6.32 |