Scientific Reasoning on Biology
74.4Avg@16DRIFT
Evaluation Results
| Method | Links | ||||
|---|---|---|---|---|---|
| DRIFTBase Model=Qwen3-8B, Evaluation Protocol=mean@162026.06 | 74.4 | — | — | — | |
| SRPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 72.8 | — | — | — | |
| DistILBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 66.6 | — | — | — | |
| SC-SDPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 65.4 | — | — | — | |
| SDPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Reproduced2026.06 | 64.8 | — | — | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | 63.8 | — | — | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | 63.8 | — | — | — | |
| PGPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 61.3 | — | — | — | |
| GRPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 59.9 | — | — | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=5h2026.01 | 58.3 | — | — | — | |
| SDPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Cited from prior work2026.06 | 56.8 | — | — | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | 56.1 | — | — | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | 54.2 | — | — | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Training Time=1h2026.01 | 54.2 | — | — | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=1h2026.01 | 53.1 | — | — | — | |
| SDPO (on-policy)Backbone=Qwen3-8B, Training Time=5h2026.01 | 53.1 | — | — | — | |
| GRPOBackbone=Qwen3-8B, Training Time=5h2026.01 | 51.8 | — | — | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=5h2026.01 | 49.4 | — | — | — | |
| GRPOBase Model=Qwen3-8B, Evaluation Protocol=mean@16, Source=Reproduced2026.06 | 47.4 | — | — | — | |
| GRPOBackbone=Qwen3-8B, Training Time=1h2026.01 | 34.3 | — | — | — | |
| Qwen3-8BBase Model=Qwen3-8B, Evaluation Protocol=mean@162026.06 | 30.8 | — | — | — | |
| GRPO (on-policy)Backbone=Qwen3-8B, Training Time=1h2026.01 | 30.3 | — | — | — | |
| Qwen3-8BTraining Time=0h2026.01 | 27.9 | — | — | — | |
| Olmo3-7B-InstructTraining Time=0h2026.01 | 18.1 | — | — | — | |
| GRPOBackbone=Qwen3-8B, Algorithm=GRPO, Policy Type=off-policy2026.01 | — | 34.3 | 51.8 | — | |
| GRPOBackbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=off-policy2026.01 | — | 47.8 | 62 | — | |
| GRPOModel Scale=8B2026.04 | — | 46.9 | 68.1 | 70.6 | |
| GRPOModel Scale=4B2026.04 | — | 39.1 | 51.6 | 55.5 | |
| GRPO (on-policy)Backbone=Qwen3-8B, Algorithm=GRPO, Policy Type=on-policy2026.01 | — | 44.4 | 44.4 | — | |
| GRPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=GRPO, Policy Type=on-policy2026.01 | — | 54.2 | 63.8 | — | |
| Olmo3-7B-InstructBackbone=Olmo3-7B-Instruct, Algorithm=None, Policy Type=N/A2026.01 | — | 18.1 | — | — | |
| Qwen3-4BModel Scale=4B2026.04 | — | 30.8 | — | — | |
| Qwen3-8BBackbone=Qwen3-8B, Algorithm=None, Policy Type=N/A2026.01 | — | 27.9 | — | — | |
| Qwen3-8BModel Scale=8B2026.04 | — | 30.5 | — | — | |
| SDPOModel Scale=8B2026.04 | — | 52.1 | 58.5 | 58.5 | |
| SDPOModel Scale=4B2026.04 | — | 54 | 54 | 54 | |
| SDPO (on-policy)Backbone=Qwen3-8B, Algorithm=SDPO, Policy Type=on-policy2026.01 | — | 51.5 | 52.9 | — | |
| SDPO (on-policy)Backbone=Olmo3-7B-Instruct, Algorithm=SDPO, Policy Type=on-policy2026.01 | — | 56.1 | 58.3 | — | |
| SRPOModel Scale=8B2026.04 | — | 55.8 | 68.3 | 72.8 | |
| SRPOModel Scale=4B2026.04 | — | 53.8 | 58.6 | 65.8 |