Interactive Decision Making on SciWorld
67.3ScoreAMC (ReAct)
Evaluation Results
| Method | Links | |
|---|---|---|
| AMC (ReAct)Policy Model=GPT-4.1-mini, Value Model Backbone=Llama-3.1-8B2026.06 | 67.3 | |
| Best-of-15 (ReAct)Policy Model=GPT-4.1-mini2026.06 | 61.6 | |
| AMC (ReAct)Policy Model=GPT-5.1, Value Model Backbone=Llama-3.1-8B2026.06 | 59.7 | |
| Best-of-15 (ReAct)Policy Model=GPT-5.12026.06 | 53.3 | |
| AMC (ReflAct)Policy Model=Llama-3.1-8B, Value Model Backbone=Llama-3.1-8B2026.06 | 37.6 | |
| AMC (ReAct)Policy Model=Llama-3.1-8B, Value Model Backbone=Llama-3.1-8B2026.06 | 34.7 | |
| Best-of-15 (ReflAct)Policy Model=Llama-3.1-8B2026.06 | 34.7 | |
| Best-of-15 (ReAct)Policy Model=Llama-3.1-8B2026.06 | 31.1 | |
| ReActPolicy Model=GPT-4.1-mini2026.06 | 25 | |
| ReActPolicy Model=GPT-5.12026.06 | 9 | |
| ReflActPolicy Model=Llama-3.1-8B2026.06 | 5.1 | |
| ReActPolicy Model=Llama-3.1-8B2026.06 | 1.3 |