Scientific Reasoning on ScienceWorld Seen
71.6Average RewardLlama-2-7B-Chat + RFT
Evaluation Results
| Method | Links | |
|---|---|---|
| Llama-2-7B-Chat + RFTAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 71.6 | |
| Co-Evolving AgentsAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 69.7 | |
| Llama-2-7B-Chat + ETOAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 65.6 | |
| Co-Evolving AgentsBackbone=Qwen3-4B-Instruct-25072025.11 | 65.1 | |
| Llama-2-7B-Chat + PPOAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 59.4 | |
| ETOBackbone=Qwen3-4B-Instruct-25072025.11 | 58.6 | |
| Llama-2-7B-Chat + SFTAdaptation=Fine-tuning, Backbone=Llama-2-7B-Chat2025.11 | 47.3 | |
| SFTBackbone=Qwen3-4B-Instruct-25072025.11 | 43.6 | |
| GPT-4Adaptation=In-context2025.11 | 42.9 | |
| GPT-3.5-TurboAdaptation=In-context2025.11 | 7.9 |