Interactive Science Reasoning on ScienceWorld (test)
84.6ScoreCOPO
Evaluation Results
| Method | Links | |||
|---|---|---|---|---|
| COPOBackbone=Qwen2.5-7B-Instruct2026.02 | 84.6 | 72 | 1,543.4 | |
| COPOBackbone=Llama3.1-8B-Instruct2026.02 | 83.7 | 70.5 | 963.8 | |
| COSFT + GiGPOBackbone=Llama3.1-8B-Instruct2026.02 | 78.2 | 64 | 4,651.3 | |
| COSFT + GRPOBackbone=Llama3.1-8B-Instruct2026.02 | 75.1 | 50.5 | 5,757.6 | |
| COSFTexpBackbone=Llama3.1-8B-Instruct2026.02 | 73.3 | 49.5 | 4,588.9 | |
| openai-o3Backbone=Frontier Large Models2026.02 | 72.4 | 54 | 5,184 | |
| COSFT + GRPOBackbone=Qwen2.5-7B-Instruct2026.02 | 71.1 | 53 | 3,739.9 | |
| COSFT + GiGPOBackbone=Qwen2.5-7B-Instruct2026.02 | 67.3 | 47 | 4,602.8 | |
| gemini-2.5-pro-0506Backbone=Frontier Large Models2026.02 | 65.2 | 44 | 8,942.4 | |
| AdaptThinkBackbone=Qwen2.5-7B-Instruct2026.02 | 62.5 | 44.5 | 1,314.2 | |
| ETOBackbone=Llama3.1-8B-Instruct2026.02 | 62.5 | 38.5 | 784.2 | |
| COSFTexpBackbone=Qwen2.5-7B-Instruct2026.02 | 61.2 | 29.5 | 3,973.8 | |
| COSFTBackbone=Qwen2.5-7B-Instruct2026.02 | 61.1 | 35.5 | 3,643.4 | |
| SFTBackbone=Llama3.1-8B-Instruct2026.02 | 59.9 | 24 | 906.6 | |
| deepseek-r1-0528Backbone=Frontier Large Models2026.02 | 58.9 | 40 | 16,502.7 | |
| gpt-4o-2024-08-06Backbone=Frontier Large Models2026.02 | 57 | 22.5 | 1,009.9 | |
| COSFTBackbone=Llama3.1-8B-Instruct2026.02 | 56.4 | 26 | 3,728 | |
| SFTBackbone=Qwen2.5-7B-Instruct2026.02 | 54.1 | 19 | 660.8 | |
| ETOBackbone=Qwen2.5-7B-Instruct2026.02 | 53.9 | 21.5 | 694.3 | |
| AdaptThinkBackbone=Llama3.1-8B-Instruct2026.02 | 52.3 | 45.5 | 1,666.8 | |
| ReflexionBackbone=Llama3.1-8B-Instruct2026.02 | 17.8 | 2.5 | 5,072.4 | |
| ReActBackbone=Llama3.1-8B-Instruct2026.02 | 13.7 | 3 | 1,268.1 | |
| deepseek-v3-0324Backbone=Frontier Large Models2026.02 | 13 | 6 | 1,013.4 | |
| ReflexionBackbone=Qwen2.5-7B-Instruct2026.02 | 10.1 | 1 | 3,396.8 | |
| ReActBackbone=Qwen2.5-7B-Instruct2026.02 | 8 | 2.5 | 1,645.1 | |
| ReAct + R1-DistillBackbone=Qwen2.5-7B-Instruct2026.02 | 2.5 | 0.5 | 21,221.9 | |
| ReAct + R1-DistillBackbone=Llama3.1-8B-Instruct2026.02 | 2.2 | 0 | 6,940.8 |