Interactive Agent Task on ScienceWorld Unseen
75.67Average RewardBPO
Evaluation Results
| Method | Links | |
|---|---|---|
| BPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 75.67 | |
| Deepseek-R1Approach=System-2, Evaluation Protocol=Zero-shot2025.08 | 61.13 | |
| ETOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 58.16 | |
| o3-miniApproach=System-2, Evaluation Protocol=Zero-shot2025.08 | 54.55 | |
| MPOApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 53.24 | |
| SFTApproach=System-2, Evaluation Protocol=Fine-Tuned, Base Model=Llama-3.1-8B-Instruct2025.08 | 51.97 | |
| Qwen-3-ThinkingApproach=System-2, Evaluation Protocol=Zero-shot2025.08 | 46.99 | |
| Llama-3.1-8B-InstructApproach=System-1, Evaluation Protocol=Zero-shot2025.08 | 28.18 | |
| Qwen-2.5-7B-InstructApproach=System-1, Evaluation Protocol=Zero-shot2025.08 | 27.32 |