Embodied Science Experiments on SciWorld Seen
76.3Average Accumulated RewardQ-Evolve
Evaluation Results
| Method | Links | |
|---|---|---|
| Q-EvolveBackbone=Llama-2-7B-Chat2026.06 | 76.3 | |
| QLASSBackbone=Llama-2-7B-Chat2026.06 | 75.3 | |
| ETOBackbone=Llama-2-7B-Chat2026.06 | 73.8 | |
| DMPOBackbone=Llama-2-7B-Chat2026.06 | 72.4 | |
| RFTBackbone=Llama-2-7B-Chat2026.06 | 71.6 | |
| Best-of-NBackbone=Llama-2-7B-Chat, N=62026.06 | 70.2 | |
| SFTBackbone=Llama-2-7B-Chat2026.06 | 67.4 | |
| GPT-4Prompting=ReAct2026.06 | 64.8 | |
| ReflexionPrompting=ReAct2026.06 | 60.3 | |
| PPOBackbone=Llama-2-7B-Chat2026.06 | 59.4 | |
| GPT-3.5-TurboPrompting=ReAct2026.06 | 16.5 | |
| Base AgentBackbone=Llama-2-7B-Chat2026.06 | 3.8 |